基于机器学习的医疗文献主题分类模型
摘要:随着医疗信息化的发展,医疗领域积累了海量的医疗文献信息。然而,这些文献中存在不少不实医学结论,严重干扰了医生获取有用信息,对医疗工作的开展极为不利。本文构建了基于机器学习的医疗文献主题分类模型,旨在帮助医生迅速获取准确的医疗文献分类信息提升医疗工作质量。
本文以阿里天池站提供的已标记医疗文献主题数据为研究对象。文中先对医疗文献主题数据进行预处理;并进行医疗文献主题数据分析;基于SVM算法和朴素贝叶斯算法对医疗文献主题进行训练分类,通过 AUC 值、F1 值等指标比较两种算法的医疗文献主题分类效果。
经验证,基于SVM 算法和朴素贝叶斯算法训练得到的医疗文献主题分类准确率均在 0.94 以上,由此可见医疗文献主题分类效果良好。
关键词:医疗文献主题分类;SVM算法;朴素贝叶斯算法;
研究背景
随着医疗信息化的发展,医疗领域积累了海量的文献信息。这些医疗文献是医疗知识传承与创新的重要资料。然而,其中掺杂着大量不实的医学结论,例如虚假的疾病治疗方案、错误的药物疗效论断等。医生每天cells处理大量医务工作,既要对患者进行诊断治疗,又要汲取前沿知识,但受到不良医疗信息的干扰,医生很难从中提取有用的医疗文献。随着医疗文献信息不断增多,传统人工筛选方式效率极为低下,且极易出错。机器学习算法的兴起为解决这一问题带来了契机,构建基于机器学习的医疗文献处理模型,对提升医疗工作效率与质量具有重大意义。
研究目的意义
构建基于机器学习的医疗文献主题分类模型意义如下:
对医生而言,可以大幅节省筛选文献时间,快速获取精准知识,提升诊疗水平与科研效率。
从医疗行业角度来看,可以净化医疗信息环境,使得医疗知识可以高效的传播与应用,推动行业良性发展。
在社会层面而言,看见恶意减少因错误医疗信息导致的医患纠纷,保障公众健康权益,提升全民医疗服务质量,为构建更完善的医疗体系筑牢信息基石 。
主要工作
本文围绕标记的医疗文献主题数据展开讨论,重点研究医疗文献主题分析以及识别模型的训练等内容,具体工作如下:
(1)网络收集医疗文献主题样本数据,分为临床医学 、生物医学等。
(2)医疗文献主题样本数据清洗及预处理,对空的或者重复的医疗文献主题进行清洗。
(3)医疗文献主题样本数据结合停用词表得到有效的关键词数据。
(4)医疗文献主题样本数据统计分析,按照医疗文献主题分类通过柱状图形式展示医疗文献主题样本统计数据;通过词云图展示医疗文献主题高频词,通过条形图展示医疗文献主题高频词的医疗文献主题数量情况。
(5)基于SVM算法的医疗文献主题分类构建,通过TF-IDF提取医疗文献主题数据样本特征,标记样本标签为临床医学、生物医学两种;拆分医疗文献主题训练集、测试集;训练医疗文献主题分类,通过错误矩阵、AUC值等评估医疗文献主题分类。
(6)基于朴素贝叶斯算法的医疗文献主题分类构建,训练医疗文献主题分类,通过错误矩阵、AUC值等评估医疗文献主题分类。
(7)比较不同的医疗文献主题分类,通过查准率、查全率、F1等指标进行评估,并展示测试集预测结果。
(8)实现医疗文献主题分类功能,输入医疗文献主题内容,能够完成医疗文献主题分类。
章节安排
本文主要完成基于机器学习的医疗文献主题分类模型,本论文章节安排如下。
第1章绪论,围绕医疗文献主题的重要性以及医疗文献主题造成的社会危害等背景进行描述,分析医疗文献主题分类课题研究的意义,描述了国内外关于医疗文献主题分类课题研究情况,并安排主要工作和章节内容。
第2章,医疗文献主题分析相关概念及技术介绍,对医疗文献主题分析以及识别用到的TF-IDF、SVM算法、朴素贝叶斯算法以及错误矩阵等进阶指标概念进行描述。
第3章医疗文献主题数据处理,围绕医疗文献主题数据的整理准备、医疗文献主题数据转换以及清洗、生成医疗文献主题关键词等工作展开讨论。
第4章医疗文献主题数据可视分析,从医疗文献主题分类、医疗文献主题关键词等角度对医疗文献主题数据进行可视分析。
第5章医疗文献主题分类分析,围绕医疗文献主题数据特征和标签构建过程、以及基于SVM算法和朴素贝叶斯算法的医疗文献主题分类分析过程展开讨论。
第6章总结与展望,总结基于机器学习的医疗文献主题分类模型研究工作,最后阐述了当前医疗文献主题分析工作的下步工作。
医疗文献主题数据整理
随着医疗文献主题日益泛滥,网上关于医疗文献主题的数据较多,通过医疗文献主题关键词搜索,本文从阿里天池站搜索关于医疗文献主题的相关数据,这些数据集主要分类有临床医学、生物医学等各种分类的医疗文献主题。下载收集这些医疗文献主题和临床医学数据,经过整理得到的医疗文献主题和临床医学的数据共计3256条,将医疗文献主题数据存储在“医疗文献主题数据.xls”文件中,将临床医学数据存储在“临床医学数据.xls”文件中,使用设置的医疗文献主题数据导入方法SpamMsgExcelAdd(),将存储在Excel文件中的医疗文献主题数据和临床医学数据进行合并整理,导入到数据表中,作为下文医疗文献主题分类的初期数据源。其中医疗文献主题数据初期数据源如下图所示。

医疗文献主题分类统计分析
根据上文,医疗文献主题分类即本次要识别的目标,分为临床医学和医疗文献主题这两种类别。本文借助SpamMsgTongStateCnt()方法,完成不同医疗文献主题分类的数据量统计,并计算各类别占比。各医疗文献主题分类对应的医疗文献主题统计数量及百分比如表4-1所示。随后,将统计得出的各医疗文献主题分类数量占比与环形图插件关联,生成医疗文献主题分类统计环形图,如图4-1所示;同时,把不同医疗文献主题分类的统计数量与条形图绑定,得到医疗文献主题分类统计条形图,如图

从医疗文献主题分类统计环形图可以看出,医疗文献主题在整个数据样本中占比较大,达到一半以上的比例,而临床医学的样本占比相对较小,未达一半。整体而言,两者样本数量比例较为均衡,因此现有的医疗文献主题数据样本符合医疗文献主题分类训练的数据源要求。

过医疗文献主题分类统计条形图能够具体地看到,临床医学分类的样本数量为1373条,医疗文献主题分类的样本数量为1883条。因此,通过数量比较可知,医疗文献主题的样本数量比临床医学的样本数量多一些,但差距并不显著。故而同样可以得出,现有的医疗文献主题数据样本符合医疗文献主题分类训练的数据源要求。
生物医学类高频词分析
生物医学类高频词分析是指对医疗文献主题分类为生物医学的所有数据样本的高频关键词进行分析,从而掌握医疗文献主题中常见的关键词组有哪些。通过设置好的方法SpamMsgKeyCnt(),并传递医疗文献主题分类为生物医学的条件,首先将生物医学分类下所有数据样本的关键词提取出来,然后通过Collections方法来计算每个医疗文献主题关键词在所有生物医学下的医疗文献主题数据样本中数量,并抽取排在前列的医疗文献主题高频词,将其通过词云图显示出来,得到的生物医学类高频词的词云图如图

通过生物医学类高频词词云图,其中最为明显的主要关键词为算法(algorithm)、方法(methods、approach)、模型(model)、数据(data)、学习(learning)、系统(systems)、图像(image)、特征(feature)、检测(detection)、神经网络(networks)、细胞(cells)、蛋白质(protein)等词语,从这些关键词可以看出医疗文献主题基本是围绕技术方法、生物医学及应用场景等相关内容展开的。
生物医学类高频词统计分析
通过生物医学类高频词词云图,我们能从感官角度分析生物医学类医疗文献主题的常见高频词情况,但该方式缺乏具体量化体现。因此,我们同样采用预先设置好的SpamMsgKeyCnt()方法,并传入医疗文献主题分类为生物医学这一条件。首先,提取生物医学分类下所有数据样本的关键词;接着,运用Collections方法统计每个医疗文献主题关键词在所有生物医学类医疗文献主题数据样本中出现的数量,并选取数量排在前列的生物医学类高频词,将其通过条形图展示出来,得到的生物医学类高频词条形图如图

临床医学高频词分析
临床医学高频词分析是指对医疗文献主题分类为临床医学的所有数据样本的高频关键词进行分析,从而掌握临床医学中常见的关键词组有哪些。通过设置好的方法SpamMsgKeyCnt(),并传递医疗文献主题分类为临床医学的条件,首先将临床医学分类下所有数据样本的关键词提取出来,然后通过Collections方法来计算每个临床医学关键词在所有临床医学数据样本中数量,并抽取排在前列的临床医学高频词,将其通过词云图显示出来,得到的临床医学高频词的词云图如图

医疗文献主题数据特征以及标签生成
目前医疗文献主题数据样本中,医疗文献主题内容的意思以关键词形式体现,要将医疗文献主题内容关键词生成可识别的数据集,则通过TF-IDF模型方法完成从医疗文献主题内容关键词中转为医疗文献主题数据特征向量。本文通过设定的SpamMsgFect()方法生成医疗文献主题数据特征以及标签。
(1)首先读取所有有效的医疗文献主题数据样本,然后将每条医疗文献主题数据样本中的关键词提取生成医疗文献主题语料库。
(2)通过CountVectorizer()方法将医疗文献主题语料库中的关键词数据转为医疗文献主题关键词词频矩阵。
(3)基于医疗文献主题关键词词频矩阵TfidfTransformer库中的fit方法完成计算医疗文献主题语料库中的关键词的TF-IDF值,生成医疗文献主题数据特征向量,同时将医疗文献主题分类作为标签。得到的医疗文献主题数据特征向量如下表所示。

更多推荐


所有评论(0)