第6章 机器学习和图像处理在乳腺癌检测中的应用

6.1 引言

在医疗保健领域实施高级计算机应用需要采用综合方法。这些方法具有社会、经济、政治和文化影响,同时也面临通信与信息技术方面的挑战。数据分析与智能数据结合计算技术,正受到医疗保健领域广泛关注(Spruit& Lytras, 2018)。

在现代,许多发达国家正在迈向智慧城市概念。在智慧城市中,所有事物都由计算机控制。世界的各个领域都在向计算机方向发展。人类希望借助计算机控制一切。决策是在智能环境中面临的一大挑战。这个现代时代也被称为数据世界,因为用户每天都会产生大量数据。这些数据对于打造智能环境非常有用。基于数据进行决策。人工智能(AI)使计算机能够做出决策。为了实现决策,必须让计算机能够获取数据(Lytras & Visvizi, 2018;Razzaq Malik 等,2017)。

医疗保健是全球面临的一大挑战。计算机、智能系统和智能设备在医疗保健中发挥着重要作用。疾病的早期检测可以降低人类生命风险。通过新创新可以减少人类生命风险。

癌症是世界上最致命的疾病。严重状况是每年有成千上万的人死于癌症。因为医生无法在早期阶段诊断出癌症。有时癌症症状无法从体外观察到。在第二或第三阶段,癌症无法被治愈。一些最新技术可以治愈这种疾病,但这些技术也有一些副作用。因此,癌症的早期检测可以降低患者生命的风险。

乳腺癌是导致女性死亡的第二大疾病。据报道,2017年美国确诊了250万例癌症病例,预计有4万名女性将因此死亡(DeSantis、Ma、Goding Sauer、Newman和Jemal,2017)。

国际癌症研究机构的一份报告显示,2012年有820万死亡人数由癌症导致。预计在2030年之前,将出现2700万新增癌症病例(Patel、Uvaid和Suthar,2012)。

国际癌症机构的一份报告指出,有7.9万名女性正面临乳腺癌这种疾病(Sreeja、Rathika和Devaraj,2012)。

这一比例在发达国家中正在上升。这是医疗保健领域的一个关键问题。那些不受控制且快速生长的细胞被称为癌症。乳腺癌是由于乳房内细胞生长而发生的。一组额外的组织被称为肿瘤。肿瘤的另一个名称是癌症。

本文中,我们开发了一种从乳腺X线图像预测乳腺癌的模型。我们采用了一种结合乳腺X光图像处理和机器学习(ML)算法的混合方法。乳腺X光图像处理技术用于从乳腺X线图像中提取特征。具有恶性或良性异常的图像由机器学习(ML)进行分类。

这些图像来自乳腺X光图像分析协会(MIAS)癌症数据集(Suckling等人,2015)。

在第一阶段,图像经过预处理,然后进入分割阶段。在第二阶段,提取特征。在第三阶段,基于特征进行分类。在最后阶段,对不同分类技术进行了比较。能够给出最佳结果的分类技术可用于新乳腺X线图像的癌症预测。

6.1.1 乳腺X光检查

为了检查乳腺癌疾病的症状,可以使用乳腺X线摄影。女性乳房的X光图被称为乳腺X线照片。当女性没有乳腺癌症状时,会进行筛查性乳腺X线摄影。该过程可降低40~70岁女性因乳腺癌导致的死亡。此过程也存在一些缺点。有时乳房并无症状,但乳腺X线照片显示异常,这会引起焦虑,因为需要进行更多检查。有乳腺癌症状的年轻女性会接受乳腺X线摄影。

乳腺存在异常的X射线图像被称为乳腺X线照片。通过将乳腺在两块板之间压缩,应用X射线束来获取图像。乳腺癌可以通过这些图像进行诊断。所采用的技术

在女性乳房出现症状之前进行的乳腺X线摄影称为筛查性乳腺X线摄影。在女性乳房出现症状之后进行的乳腺X线摄影称为诊断性乳腺X线摄影。乳腺X线摄影是目前检测早期乳腺癌最有效的技术(Sundaram,Sasikala和Rani,2014)。

6.1.2 预处理

预处理的目的是增强乳腺X线图像。因为增强能够提供更准确的结果。在此阶段,我们从乳腺X线照片中去除噪声。去除噪声是为了使图像更清晰。这种清晰度提供了清晰的边缘和边界。增强不会增加或减少乳腺X线图像本身,它仅提高特征的清晰度。

乳腺X线图像预处理是一种用于提高乳腺X线图像质量的技术。乳腺X线图像预处理的目的是清除噪声并增强乳腺X线图像质量,以便进行后续处理。图像滤波器用于去除无关的伪影并增强图像质量(John和Nallathambi,2017)。

6.1.3 分割

分割是寻找感兴趣区域(ROI)的过程。在此阶段,选择包含肿瘤的区域。这一阶段对于获得我们的结果至关重要,因为如果不提取感兴趣区域(ROI),则需要对整幅图像进行处理以提取特征。因此,感兴趣区域(ROI)有助于获取所需的特征。在此过程中,从乳腺X线图像中提取肿瘤区域,随后对感兴趣区域(ROI)图像进行特征提取。

图像分割采用两种方法。第一种方法中,作者通过定位边缘来区分图像区域。该方法被称为基于边缘的图像分割技术。第二种方法中,作者通过将独立像素组合成块,将图像分割成小块。该方法称为基于区域的分割(Bandyopadhyay,2010)。

6.1.4 机器学习

机器学习是人工智能的一个子领域。它主要有两种类型。有监督算法使用标记数据进行训练,无监督算法使用未标记数据进行训练。在标记数据中,分类标签是已知的。在我的案例中,标签“0”表示正常情况,标签“1”表示癌变情况。机器学习分为四个子类别。

  • 监督式机器学习
  • 无监督学习
  • 半监督学习
  • 强化学习和深度学习
6.1.4.1 监督机器学习

在监督式机器学习中,实际使用了两个变量。一个是(T),即输入变量;另一个是(P),即输出变量。算法通过学习从输入到输出的映射函数。

$$ P = f(T) $$

该映射函数的目标是根据变量(T)的新输入数据预测变量(P)的输出值。这被称为监督学习。算法从训练数据集中学习,并对新数据做出预测。当达到可接受的性能时,学习停止。

监督学习被分为两类。

  • 分类
  • 回归
6.1.4.1.1 分类

当输出变量为“是”或“否”时,使用分类。当输出变量为“疾病”或“正常”时,则应用分类。

6.1.4.1.2 回归

当输出变量具有“工资”或“体重”等实数或连续值时,使用回归。

6.1.4.2 无监督学习

无监督学习应用于仅提供T变量的情况,这意味着只给出了输入数据,而输出变量未知。无监督学习的目标是理解数据的结构或数据分布。之所以称为无监督学习,是因为没有输出变量,即我们不知道输入数据的实际答案。在无监督学习中,算法会自行在给定的数据分布中发现模式。无监督学习进一步细分为关联和聚类。

  • 聚类
  • 关联
6.1.4.2.1 聚类

聚类是将同类型的数据进行分组的过程,使得同一簇内的数据具有相似性。这意味着同一组或簇内的数据更为相似,而不同组或数据簇之间则存在差异。例如,学院会根据学生的智商将学生分到优等班、中等班和基础班。另一个例子是,书籍按照其领域被分类放置在书架上。

6.1.4.2.2 关联

关联是指在数据中发现有趣的模式。通常用于无监督学习中,以发现数据中的频繁模式。例如,我们可以在超市数据中发现一个频繁模式,如 [butter, egg] → [bread] 规则表明,从超市购买黄油和鸡蛋的顾客很可能也会购买面包。

6.1.4.3 半监督学习

它类似于监督学习,但区别在于它也使用未标记数据进行训练。大多数情况下,标记数据较少,而未标记数据较多。这意味着它介于有监督和无监督之间。

6.1.4.4 强化学习和深度学习

这两种技术都是自主的且具备自学习能力。这些算法通过数百万条数据进行学习。但两者之间的区别在于,强化学习通过试错机制进行学习,而深度学习则从数百万条数据中寻找模式(Haider, Malik, Khalid, Nawaz,& Jabbar, 2017)。例如,为了识别恐龙照片,会向算法提供数百万张恐龙照片以实现自学习。

6.2 文献综述

作者使用了三种机器学习技术来预测乳腺癌。他们使用ICBC数据集,在德黑兰国家癌症研究所进行实验并提取结果。他们在ICBC数据集上应用了三种机器算法(ANN、决策树和SVM)。他们观察到SVM的准确率最高,为95%,ANN为94%,而决策树的准确率较低,为93%(Ahmad,Eshlaghy, Poorebrahimi, Ebrahimi,& Razavi, 2013)。

本文中,作者开发了一个结合CFRSFS、K‐均值聚类和最小二乘支持向量机的系统。作者提出了一种名为CFRSFS的特征选择算法。CFRSFS仅选择八个特征,并将其输入K‐均值聚类进行进一步的特征处理。他们的方法准确率达到99.54%(Suji& Rajagopalan, 2015)。

在本文中,作者根据数据集应用了不同的机器学习算法。他们使用WDBC数据集获得了实验结果。他们计算了准确率

算法如线性支持向量机 68%,逻辑回归 68%,K近邻 72%,以及朴素贝叶斯 67% (Rana, Chandorkar,Dsouza, & Kazi, 2015)。

本文中,作者使用神经网络来检测乳腺癌。他们使用了1808例癌症病例,其中387例用于测试。他们计算出神经网络算法的准确率为95.80%(Singh, Gupta 和 Sharma,2010年)。

前文相关工作列于 表6.1。

No. 作者 技术或算法 数据集 准确率 (%)
1 Ahmad 等人 (2013) 决策树 人工神经网络 支持向量机 ICBC 93 94 95
2 Suji 和 Rajagopalan (2015) CFRSFS, K‐均值 威斯康星诊断乳腺 癌症 (WDBC) 99.54
3 Rana 等人 (2015) KNN SVM 逻辑回归 朴素贝叶斯 WDBC 72 68 68 67

6.3 提出的工作

示意图0

6.3.1 数据集

样本数据集取自MIAS(Suckling等人,2015)。这是一个英国研究小组。该研究小组致力于理解乳腺X线图像。这些图像来自英国国家乳腺筛查中心。该数据集包含322个实例。该数据集中的原始图像如图6.2所示。图像在Matlab工具中显示。此图像被发送到预处理模块。

示意图1

6.3.2 噪声去除(预处理)

预处理的目的是增强乳腺X线图像,因为增强能够提供更准确的结果。在此阶段,我们从乳腺X线照片中去除噪声。去除噪声是为了使图像更清晰,这种清晰度可产生清晰的边缘和边界。增强不会增加或减少乳腺X线图像本身,而只是增强特征的清晰度。

乳腺X线图像预处理是一种用于提高乳腺X线图像质量的技术。乳腺X线图像预处理的目的是清除噪声并提升乳腺X线图像质量,以便进行后续处理。

进一步处理。图像滤波器用于去除无关的伪影并提高图像质量。在此步骤中,图像从数据库加载并进行预处理以去除图像中的噪声。此步骤提高了图像的质量。该步骤是必要的,因为原始乳腺X线图像包含噪声和其他伪影。我将应用二维中值滤波器来去除图像中的噪声。平均滤波器和自适应滤波器也可用于去噪。但在本例中,中值滤波器已足够去除噪声。在图6.3中,显示了预处理图像。该图像无噪声。为了去除噪声,应用了中值滤波器。此模块也在Matlab工具中执行。

示意图2

6.3.3 分割过程

分割是选择感兴趣区域(ROI)的过程。在此过程中,去除噪声后选择包含肿瘤的区域。这一步骤非常必要,因为从整幅图像中提取特征非常困难。我们只希望从包含肿瘤或癌症的区域提取特征。分割可以通过Grab Cut算法、阈值分割和分水岭算法实现。

因此,我将采用阈值分割进行分割。分割图像将用于特征提取。分割是寻找感兴趣区域(ROI)的过程。在此阶段,选择包含肿瘤的区域。该阶段对获得结果至关重要,因为如果未提取感兴趣区域,则需要对整幅图像进行处理以提取特征。因此,感兴趣区域有助于获取所需的特征。在此过程中,从乳腺X线图像中提取肿瘤区域,随后对 ROI图像进行特征提取。图像分割使用了两种方法。在

第一种方法中,作者通过定位边缘来区分图像的区域。这种方法被称为基于边缘的图像分割技术。在第二种方法中,作者通过将单独的像素组合成块来将图像分割成小块。这种方法被称为基于区域的分割。图6.4 给出了一幅二值图像。具有白色颜色的像素值为“1”,黑色像素值为“0”。

结合后,二值图像和原始图像得到了一个显示肿瘤的掩膜图像,如图6.5所示。

在 图6.6中,显示了特征提取所需的分割图像。

示意图3

示意图4

示意图5

6.3.4 特征提取

在此步骤中,我将使用分割图像来提取特征。这些特征将描述癌症的状况。将从分割图像中提取的特征包括:

  1. 高亮区域的半径;
  2. 高亮区域的熵;
  3. 高亮区域的平滑度;
  4. 高亮区域的平均纹理;
  5. 基于纹理的特征。

第6章 机器学习和图像处理在乳腺癌检测中的应用

6.3.5 训练模型和测试

在此步骤中,特征标签数据将被分为两部分。一部分用于训练,另一部分用于测试。训练数据用于训练模型。我们通过提供未标记的测试数据来测量精确率和召回率。

6.3.6 分类

在此步骤中,预测或测试数据将被输入模型,并提取分类标签。所应用的分类模型包括支持向量机(SVM)、Ada Boost、决策树、逻辑回归、K最近邻和随机森林分类器。每种算法都会给出二分类的结果。利用这些二分类结果,将计算性能度量指标。该度量将帮助我们比较结果。基于对算法的比较,我们可以推荐最适合用于解决给定医疗保健问题的技术。

6.3.7 性能评价指标

为了评估算法性能,使用了混淆矩阵,并应用了精确率、召回率、F分数、敏感度、特异性和准确率的一些公式。

PT = 真正例
PF = 假正例
NT = 真负例
NF = 假负例

混淆矩阵将预测实例划分为四种结果,如上所示。PT 表示预测为无癌症的实例是正确的,这意味着这些实例确实没有癌症,算法的预测结果正确。PF 表示预测结果不正确,实际实例没有癌症,但算法判断存在癌症,即算法预测错误。NT 与 PT 类似,实例中确实存在癌症,算法也预测出有癌症,算法结果正确。最后,NF 表示实际实例有癌症,但算法预测该实例没有癌症,这种情况下算法再次给出错误结果,与 PF 的情况类似。

在 表6.2中给出了混淆矩阵,描述了预测类别与实际类别之间的关系。通过四个性能指标 PT、NT、PF 和 NF 将预测类别与实际类别进行比较。

PT类表示被正确分类的良性样本。PF类表示被错误分类为良性的恶性样本。NT类表示被正确分类的恶性样本。FN类表示被错误分类为恶性的良性样本。所讨论的类别是性能度量。这些度量的定义见表 6.3。

敏感度是TP与所有标记的肿瘤(TP + FN)之间的比率。

$$ \text{Sensitivity} = \frac{\text{PT}}{\text{PT} + \text{NF}} \tag{6.1} $$

特异性是TN与被标记为肿瘤的FP(FP + TN)之间的关系。

$$ \text{Specificity} = \frac{\text{NT}}{\text{PF} + \text{NT}} \tag{6.2} $$

准确率公式(6.3)中给出。

$$ \text{Accuracy} = \frac{\text{PT} + \text{NT}}{\text{PT} + \text{PF} + \text{NF} + \text{NT}} \tag{6.3} $$

6.3.8 F分数度量

F分数是机器学习算法的评估指标。

$$ \text{Precision} = \frac{\text{PT}}{\text{PT} + \text{PF}} \tag{6.4} $$

$$ \text{Recall} = \frac{\text{PT}}{\text{PT} + \text{NF}} \tag{6.5} $$

由 公式(6.4) 和 公式(6.5) 计算精确率和准确率,并将其用于 公式(6.6) 以计算 F‐值:

$$ \text{F-measure} = \frac{2(\text{precision} \times \text{recall})}{\text{precision} + \text{recall}} \tag{6.6} $$

表6.3:性能度量

性能度量 定义
PT 正确分类的良性元组。
PF 被错误分类为良性的恶性元组。
NT 正确分类的恶性元组。
NF 被错误分类为恶性的良性元组。

PT,真正例;PF,假正例;NT,真负例;NF,假负例。

表6.2:混淆矩阵。

CM 阳性 阴性
阳性 PT NF
阴性 PF NT

TP,真正例;FP,假正例;TN,真负例;FN,假负例。

6.4 结果

在 表 6.4中,给出了输出标签及其测试分数。“0”标签表示正常情况,标签“1”表示癌变情况。这些预测标签与数据集中的原始标签进行了比较。计算了不同指标,如 表 6.5 和 6.6所示。

表 6.4:通过应用算法预测的标签

算法 输出(预测标签) Test 得分 (%)
SVM [0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0.] 76
Ada Boost [0. 0. 0. 1. 1. 0. 0. 0. 0. 0. 1. 0. 1. 0. 1. 0. 0. 0. 0. 0. 1. 0. 1. 0. 1. 0. 1. 1. 0. 0. 1. 1. 0. 0. 0. 1. 1. 1. 0. 1. 0. 0.] 66
决策树 [1. 1. 0. 1. 0. 1. 0. 0. 0. 0. 0. 1. 0. 0. 1. 0. 1. 1. 0. 1. 0. 0. 0. 0. 0. 0. 1. 1. 0. 1. 1. 1. 1. 0. 0. 1. 1. 1. 0. 1. 0. 0.] 50
Logistic 回归 [0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 1. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 0. 1.] 76
Random 随机森林 梯度 提升 [0. 1. 0. 1. 0. 0. 0. 0. 0. 0. 1. 0. 1. 0. 1. 0. 0. 0. 0. 0. 1. 0. 1. 1. 0. 0. 1. 0. 0. 0. 1. 0. 1. 0. 0. 0. 1. 0. 1. 0. 0.] 60
KNN [1. 1. 0. 1. 0. 0. 0. 0. 0. 0. 1. 0. 1. 0. 1. 0. 0. 0. 0. 1. 0. 0. 1. 0. 0. 1. 1. 1. 0. 0. 0. 1. 1. 0. 0. 1. 1. 1. 0. 1. 0. 0.] 60
KNN [0. 0. 0. 1. 0. 0. 0. 1. 0. 0. 0. 0. 1. 0. 0. 0. 0. 0. 0. 0. 0. 1. 1. 0. 0. 1. 1. 0. 0. 0. 0. 0. 0. 1. 1. 0. 0. 0. 1. 0. 0. 0.] 63

表6.5:算法的预测二分类结果

模型 总实例数 PT NT PF NF
SVM 42 38 0 4 0
Ada Boost 42 23 1 3 15
决策树 42 21 2 2 17
逻辑回归 42 36 0 4 2
随机森林 42 26 0 4 12
梯度提升 42 21 1 3 17
KNN 42 30 2 2 8

TP,真正例;FP,假正例;TN,真负例;FN,假负例。

表6.6:根据上述公式计算的算法性能

模型 测试分数 F分数 敏感度 特异性 精确率 召回率 准确率 (%)
SVM 0.77 0.95 1 0 0.90 1 90
Ada Boost 0.67 0.71 0.61 0.25 0.88 0.60 57
决策树 0.53 0.68 0.55 0.5 0.91 0.55 54
逻辑回归 0.70 0.92 0.94 0 0.90 0.95 85
随机森林 0.63 0.76 0.69 0 0.87 0.68 61
梯度提升 0.60 0.67 0.55 0.25 0.88 0.55 52
KNN 0.63 0.85 0.78 0.5 0.94 0.78 76

6.5 讨论

数据集被划分为训练数据和测试数据。训练数据包含250个实例,测试数据包含30个实例。在模型开发完成后,使用不同模型对42个实例进行预测。其二分类结果如表6.5所示。

使用上述公式,我们计算了不同算法在乳腺癌数据集上的F分数、精确率、敏感度、特异性、召回率和准确率。

图 图6.7 中给出的图表显示了不同算法的结果。每种算法预测的结果如图所示。总共测试了42个实例。SVM分类器将38个实例预测为TP,4个实例预测为FP。Ada Boost分类器将23个实例预测为TP,1个实例预测为TN,3个实例预测为FP,15个实例预测为FN。决策树分类器将21个实例预测为TP,2个实例预测为TN,2个实例预测为FP,17个实例预测为FN。逻辑回归分类器将36个实例预测为TP,4个实例预测为FP,2个实例预测为FN。随机森林分类器将26个实例预测为TP,4个实例预测为FP,12个实例预测为FN。梯度提升分类器将21个实例预测为TP,1个实例预测为TN,3个实例预测为FP,17个实例预测为FN。K最近邻分类器将30个实例预测为TP,2个实例预测为TN,2个实例预测为FP,8个实例预测为FN。这些不同分类器的结果对于计算测试分数、f‐分数、敏感度、特异性、精确率、召回率和准确率至关重要。这意味着所有结果都依赖于不同算法或分类器给出的这些输出结果。

SVM的百分比准确率最高,达到90%的准确率,如表6.6所示。类似地,梯度提升是最差的情况,其准确率、精确率和f‐分数最低。逻辑回归处于中等水平,准确率为85%,f‐分数、测试分数和精确率均处于平均水平。我的结果表明,精确率、召回率、f‐分数以及

示意图6

精确率提高会使我们的预测显示出最佳结果。但如果增加训练数据集,模型的准确率会提高。基于本项工作,我们建议可以使用支持向量机机器学习技术来识别重症疾病,因为我们的工作显示出了所获得的最高准确率。

在 图6.8中,该图为一个曲线图。此图是根据 表6.6中给出的不同指标的计算值绘制成。这些值是通过上述不同公式计算得出的。在上图中,给出了测试分数、f‐分数、敏感度、特异性、精确率、召回率和准确率。这些值是通过二分类计算得到的结果。这些结果根据二分类而变化。该图显示,具有高精确率和召回率的算法表现出高准确率。精确率和召回率较低的技术准确率较低(图6.9)。在 表6.7 中讨论了分类符号。良性是无癌症的图像类型。恶性是含有癌症的图像类型。

当SVM的西格玛值较小且c参数较大时,能够提供良好的结果。类似地,逻辑回归利用lambda参数来获得更好的性能。其性能取决于lambda参数。在某个特定的 lambda参数值下,逻辑回归的性能达到最佳,正如本例中的情况。

6.6 结论

信息技术在医疗保健中发挥着重要作用。通信技术使用户能够与医生保持联系,医生也能与其患者保持沟通。智能可穿戴传感设备在当前环境中已易于获得。患者佩戴这些传感设备并进行日常生活常规动作。如果患者身体出现任何异常,传感设备会感知到并向医生发送有关患者状况的信息。通过这一过程,医生可以根据患者的状况为其提供适当的治疗。利用智能医疗创新,可以挽救患者的生命。

我们工作的主要发现是为医疗保健领域引入了一项新创新。该创新即在医疗保健中使用计算机。根据我们的研究,计算机技术可用于重症疾病的早期检测。我们的工作基于对重症疾病乳腺癌的检测。

我们的工作有助于拯救人类生命。我们的工作基于对可用于疾病类型分类的不同算法的比较。我们的研究表明,SVM算法在癌症预测方面具有合理的准确率。因此,该技术在医疗系统中用于疾病预测是有效的。在医疗系统领域,计算机被用来尽早获得结果,以便及时对患者进行治疗。

机器学习算法用于从乳腺X线图像中预测癌症。实验结果在预测癌症方面表现良好。乳腺X线图像不适合直接挖掘症状以进行预测,因此我们需要采用多阶段策略。第一步,

表6.7:分类符号。

癌症类型 二进制符号
良性 0
恶性 1

本研究需要进行分割,进而实现特征提取。总共使用了322个实例的MIAS癌症图像数据集。在后续阶段,本工作采用了机器学习混合方法进行癌症预测。分类过程中结合使用了有监督和无监督的技术。根据不同算法确定了各种不同指标。研究结果表明, SVM分类器具有最高的准确率,能够更好地从复杂图像中预测癌症。另一方面,梯度提升分类器表现最差,准确率仅为52%。同样,梯度提升算法的精确率、召回率、测试分数和F分数均为最低。而SVM在这几项指标上均表现最高。这些特性使得SVM成为此类图像数据集更优的选择。

未来,我们的方法可用于预测肺癌、肝癌、皮肤癌、脑瘤、心脏病和糖尿病。机器学习算法通过数据集进行训练。在大数据时代,研究实验室中拥有大量来自磁共振成像、 CT扫描和乳腺X线摄影的数据集。研究人员利用这些数据集来训练机器学习算法,并对新数据做出预测。未来,这些技术将被应用于每一种疾病。医疗领域正在快速发展。未来,将使用深度学习算法以高准确率和精确率来预测和分类这种疾病。深度学习算法比本项目所使用的算法更为先进。深度学习算法需要强大的计算能力。随着计算能力的提升,研究人员能够采用更新且更精确的技术。

6.7 研究贡献亮点

  • 理解乳腺X线摄影
  • 读取乳腺X线照片
  • 感兴趣区域的发现
  • 理解乳腺X线照片的特征
  • 从乳腺X线照片中进行特征提取
  • 机器学习算法的比较
  • 对新数据的预测
  • 针对关键医疗保健问题的建议技术

6.8 教学任务

  • 乳腺X线摄影的预处理
  • 从乳腺X线摄影中进行特征提取
  • 机器学习算法的实现
  • 区分有监督和无监督学习
  • 通过机器学习解决分类问题
  • 哪种机器学习技术最佳,为什么?
Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐