基于机器学习的医疗文献主题分类模型
摘要:随着医疗信息化的发展,医疗领域积累了海量的医疗文献信息。然而,这些文献中存在不少不实医学结论,严重干扰了医生获取有用信息,对医疗工作的开展极为不利。本文构建了基于机器学习的医疗文献主题分类模型,旨在帮助医生迅速获取准确的医疗文献分类信息提升医疗工作质量。
本文以阿里天池站提供的已标记医疗文献主题数据为研究对象。文中先对医疗文献主题数据进行预处理;并进行医疗文献主题数据分析;基于SVM算法和朴素贝叶斯算法对医疗文献主题进行训练分类,通过 AUC 值、F1 值等指标比较两种算法的医疗文献主题分类效果。
经验证,基于SVM 算法和朴素贝叶斯算法训练得到的医疗文献主题分类准确率均在 0.94 以上,由此可见医疗文献主题分类效果良好。
关键词:医疗文献主题分类;SVM算法;朴素贝叶斯算法;
研究背景
随着医疗信息化的发展,医疗领域积累了海量的文献信息。这些医疗文献是医疗知识传承与创新的重要资料。然而,其中掺杂着大量不实的医学结论,例如虚假的疾病治疗方案、错误的药物疗效论断等。医生每天cells处理大量医务工作,既要对患者进行诊断治疗,又要汲取前沿知识,但受到不良医疗信息的干扰,医生很难从中提取有用的医疗文献。随着医疗文献信息不断增多,传统人工筛选方式效率极为低下,且极易出错。机器学习算法的兴起为解决这一问题带来了契机,构建基于机器学习的医疗文献处理模型,对提升医疗工作效率与质量具有重大意义。
研究目的意义
构建基于机器学习的医疗文献主题分类模型意义如下:
对医生而言,可以大幅节省筛选文献时间,快速获取精准知识,提升诊疗水平与科研效率。
从医疗行业角度来看,可以净化医疗信息环境,使得医疗知识可以高效的传播与应用,推动行业良性发展。
在社会层面而言,看见恶意减少因错误医疗信息导致的医患纠纷,保障公众健康权益,提升全民医疗服务质量,为构建更完善的医疗体系筑牢信息基石 。
主要工作
本文围绕标记的医疗文献主题数据展开讨论,重点研究医疗文献主题分析以及识别模型的训练等内容,具体工作如下:
(1)网络收集医疗文献主题样本数据,分为临床医学 、生物医学等。
(2)医疗文献主题样本数据清洗及预处理,对空的或者重复的医疗文献主题进行清洗。
(3)医疗文献主题样本数据结合停用词表得到有效的关键词数据。
(4)医疗文献主题样本数据统计分析,按照医疗文献主题分类通过柱状图形式展示医疗文献主题样本统计数据;通过词云图展示医疗文献主题高频词,通过条形图展示医疗文献主题高频词的医疗文献主题数量情况。
(5)基于SVM算法的医疗文献主题分类构建,通过TF-IDF提取医疗文献主题数据样本特征,标记样本标签为临床医学、生物医学两种;拆分医疗文献主题训练集、测试集;训练医疗文献主题分类,通过错误矩阵、AUC值等评估医疗文献主题分类。
(6)基于朴素贝叶斯算法的医疗文献主题分类构建,训练医疗文献主题分类,通过错误矩阵、AUC值等评估医疗文献主题分类。
(7)比较不同的医疗文献主题分类,通过查准率、查全率、F1等指标进行评估,并展示测试集预测结果。
(8)实现医疗文献主题分类功能,输入医疗文献主题内容,能够完成医疗文献主题分类。
章节安排
本文主要完成基于机器学习的医疗文献主题分类模型,本论文章节安排如下。
第1章绪论,围绕医疗文献主题的重要性以及医疗文献主题造成的社会危害等背景进行描述,分析医疗文献主题分类课题研究的意义,描述了国内外关于医疗文献主题分类课题研究情况,并安排主要工作和章节内容。
第2章,医疗文献主题分析相关概念及技术介绍,对医疗文献主题分析以及识别用到的TF-IDF、SVM算法、朴素贝叶斯算法以及错误矩阵等进阶指标概念进行描述。
第3章医疗文献主题数据处理,围绕医疗文献主题数据的整理准备、医疗文献主题数据转换以及清洗、生成医疗文献主题关键词等工作展开讨论。
第4章医疗文献主题数据可视分析,从医疗文献主题分类、医疗文献主题关键词等角度对医疗文献主题数据进行可视分析。
第5章医疗文献主题分类分析,围绕医疗文献主题数据特征和标签构建过程、以及基于SVM算法和朴素贝叶斯算法的医疗文献主题分类分析过程展开讨论。
第6章总结与展望,总结基于机器学习的医疗文献主题分类模型研究工作,最后阐述了当前医疗文献主题分析工作的下步工作。
医疗文献主题数据整理
随着医疗文献主题日益泛滥,网上关于医疗文献主题的数据较多,通过医疗文献主题关键词搜索,本文从阿里天池站搜索关于医疗文献主题的相关数据,这些数据集主要分类有临床医学、生物医学等各种分类的医疗文献主题。下载收集这些医疗文献主题和临床医学数据,经过整理得到的医疗文献主题和临床医学的数据共计3256条,将医疗文献主题数据存储在“医疗文献主题数据.xls”文件中,将临床医学数据存储在“临床医学数据.xls”文件中,使用设置的医疗文献主题数据导入方法SpamMsgExcelAdd(),将存储在Excel文件中的医疗文献主题数据和临床医学数据进行合并整理,导入到数据表中,作为下文医疗文献主题分类的初期数据源。其中医疗文献主题数据初期数据源如下图所示。

医疗文献主题数据转换
分析医疗文献主题数据初期数据源表,目前只有医疗文献主题分类名称,因此本文cells将医疗文献主题分类进行数据转化,将转换后的医疗文献主题分类结果存储为医疗文献主题分类,根据cells医疗文献主题分类分为1和0,其中1代表生物医学,0代表临床医学。
医疗文献主题数据清洗
从列举的医疗文献主题数据中的医疗文献主题内容可以看出,许多医疗文献主题内容中存在一些无效的内容,比如“.”等标点符号,这些内容并不能体现医疗文献主题内容主要意思,并对读取医疗文献主题数据特征methods帮助,属于无效内容,因此通过SpamChina()方法,其内部利用正则表达式原理,对句子中无效的内容进行去除,最终得到有效的医疗文献主题内容。经过清洗得到的医疗文献主题数据清洗结果如下图所示。

医疗文献主题分类统计分析
根据上文,医疗文献主题分类即本次要识别的目标,分为临床医学和医疗文献主题这两种类别。本文借助SpamMsgTongStateCnt()方法,完成不同医疗文献主题分类的数据量统计,并计算各类别占比。各医疗文献主题分类对应的医疗文献主题统计数量及百分比如表4-1所示。随后,将统计得出的各医疗文献主题分类数量占比与环形图插件关联,生成医疗文献主题分类统计环形图,如图所示;同时,把不同医疗文献主题分类的统计数量与条形图绑定,得到医疗文献主题分类统计条形图,如图


从医疗文献主题分类统计环形图可以看出,医疗文献主题在整个数据样本中占比较大,达到一半以上的比例,而临床医学的样本占比相对较小,未达一半。整体而言,两者样本数量比例较为均衡,因此现有的医疗文献主题数据样本符合医疗文献主题分类训练的数据源要求。

过医疗文献主题分类统计条形图能够具体地看到,临床医学分类的样本数量为1373条,医疗文献主题分类的样本数量为1883条。因此,通过数量比较可知,医疗文献主题的样本数量比临床医学的样本数量多一些,但差距并不显著。故而同样可以得出,现有的医疗文献主题数据样本符合医疗文献主题分类训练的数据源要求。
医疗文献主题数据样本构建
医疗文献主题数据特征以及标签生成
目前医疗文献主题数据样本中,医疗文献主题内容的意思以关键词形式体现,要将医疗文献主题内容关键词生成可识别的数据集,则通过TF-IDF模型方法完成从医疗文献主题内容关键词中转为医疗文献主题数据特征向量。本文通过设定的SpamMsgFect()方法生成医疗文献主题数据特征以及标签。
(1)首先读取所有有效的医疗文献主题数据样本,然后将每条医疗文献主题数据样本中的关键词提取生成医疗文献主题语料库。
(2)通过CountVectorizer()方法将医疗文献主题语料库中的关键词数据转为医疗文献主题关键词词频矩阵。
(3)基于医疗文献主题关键词词频矩阵TfidfTransformer库中的fit方法完成计算医疗文献主题语料库中的关键词的TF-IDF值,生成医疗文献主题数据特征向量,同时将医疗文献主题分类作为标签。得到的医疗文献主题数据特征向量如下表所示。

通过医疗文献主题数据特征向量可以看出,第23580篇医疗文献主题中,第36个关键词的TF-IDF值是0.8042627865995243,第48个关键词的TF-IDF值是0.2657850221237804,这说明第36个关键词比第48个关键词更重要。
朴素贝叶斯医疗文献主题分类模型训练
读取划分后的医疗文献主题训练集,通过GaussianNB函数声明朴素贝叶斯医疗文献主题分类模型对象。接着,将医疗文献主题训练集数据通过fit方法加载到朴素贝叶斯医疗文献主题分类模型对象中进行训练。完成朴素贝叶斯医疗文献主题分类模型训练后,将该朴素贝叶斯医疗文献主题分类模型以“TrainNBSpam.model”文件的形式存储。目前,利用医疗文献主题训练集得到的朴素贝叶斯医疗文献主题分类模型,对医疗文献主题测试集数据进行验证,得到的朴素贝叶斯医疗文献主题分类模型准确率为0.949。该准确率数值同样较高,因此可以判断朴素贝叶斯医疗文献主题分类模型同样能够作为医疗文献主题分类的判断依据。
通过比较医疗文献主题分类准确率可知,朴素贝叶斯医疗文献主题分类模型的准确率比SVM医疗文献主题分类模型的准确率稍微高一点,但差距不大,因此可以得出两者对医疗文献主题的分类效果相当。
通过错误矩阵评估医疗文献主题分类
(1)以医疗文献主题测试集数据作为验证数据,使用已设置的ProSVMSpam()方法,通过SVM医疗文献主题分类模型对医疗文献主题测试集数据的医疗文献主题进行预测分类。这里使用的是“TrainSVMSpam.model”训练文件,将预测得到的医疗文献主题测试集数据的预测结果作为已设置的SpamRPic()方法的参数,生成的SVM医疗文献主题分类模型错误矩阵热力图如图

医疗文献主题分类比较
通过准确度、错误矩阵、ROC曲线、指标值对SVM医疗文献主题分类模型和朴素贝叶斯医疗文献主题分类模型进行评估后得出,它们均能满足医疗文献主题分类的要求。下面从四个角度分析SVM医疗文献主题分类模型和朴素贝叶斯医疗文献主题分类模型的效果。
(1)准确率比较:通过比较SVM医疗文献主题分类模型和朴素贝叶斯医疗文献主题分类模型的准确率,发现二者准确率均在0.9以上,其中朴素贝叶斯医疗文献主题分类模型的准确率稍低,但影响并不明显。因此,可以得出两种医疗文献主题分类效果相当。
(2)错误矩阵比较:由于该模型的核心任务是对医疗文献主题进行分类,从比较SVM医疗文献主题分类模型和朴素贝叶斯医疗文献主题分类模型在医疗文献主题分类中的错误情况来看,SVM医疗文献主题分类模型出现7条识别错误,而朴素贝叶斯医疗文献主题分类模型存在因“methods”等因素导致对医疗文献主题错误识别的情况。但综合判断,难以直接得出朴素贝叶斯医疗文献主题分类模型效果比SVM医疗文献主题分类模型好的结论。
(3)ROC曲线以及AUC值比较:通过比较SVM医疗文献主题分类模型和朴素贝叶斯医疗文献主题分类模型的ROC曲线,发现它们在阈值以及预测准确性方面表现相当,且二者医疗文献主题分类的AUC值均达到0.9以上。因此,可以得出两种医疗文献主题分类效果相当。
(4)指标值比较:通过比较SVM医疗文献主题分类模型和朴素贝叶斯医疗文献主题分类模型的查准率、查全率、F1分值,发现二者的指标值均在0.9以上,朴素贝叶斯医疗文献主题分类模型的指标值稍低,但影响不显著。因此,可以得出两种医疗文献主题分类效果相当。
鉴于本模型的核心是对医疗文献主题进行分类,综合上述比较,难以判定朴素贝叶斯医疗文献主题分类模型就是最佳的医疗文献主题过滤识别模型,二者在多数评估维度下效果相近,需结合更多实际应用场景和需求进一步抉择。
更多推荐


所有评论(0)