一、图像分类的定义与三层境界
  1. 图像分类定义核心是将不同的图像划分到对应的类别标签,最终目标是实现最小的分类误差(即让模型正确分类的样本比例尽可能高)。

  2. 图像分类的三层境界按分类粒度与难度从低到高,分为三类:

    • 通用多类别图像分类:区分 “大类” 物体,如 10 分类任务(包含飞机、汽车、鸟、猫、鹿、狗、青蛙、马、船、卡车 10 个类别),类别间差异明显,任务难度较低。
    • 子类细粒度图像分类:区分同一 “大类” 下的细分类型,如不同品种的猫、不同型号的汽车,类别间差异小,对模型特征提取能力要求更高。
    • 实例级图片分类:区分同一物体的不同实例,如同一品牌同一型号的两辆汽车、同一只猫的不同照片,需捕捉实例专属的细微特征,任务难度最高。
二、图像分类核心评估指标

所有评估指标均基于混淆矩阵的基础概念(TP、FP、TN、FN)展开,具体如下:

1. 混淆矩阵基础概念
符号 英文全称 定义
TP True Positive 真正例:将正类样本正确预测为正类的数量
FP False Positive 假正例:将反类样本错误预测为正类的数量
TN True Negative 真反例:将反类样本正确预测为反类的数量
FN False Negative 假反例:将正类样本错误预测为反类的数量
2. 核心评估指标(单类别场景)
指标名称 计算公式 核心意义
精确率(Accuracy) (TP + TN) / (TP + FP + TN + FN) 模型整体的分类精度,即所有样本中正确分类的比例,是最常用的基础指标。一般精度越高,模型效果越好。
准确率(Precision,查准率) TP / (TP + FP) 模型预测为 “正类” 的样本中,真正是正类的比例,关注 “预测正类的准确性”,适用于需降低 “误判正类” 风险的场景(如垃圾邮件识别,避免正常邮件被误判)。
召回率(Recall,查全率) TP / (TP + FN) 所有真实 “正类” 样本中,被模型正确识别的比例,关注 “正类样本的覆盖度”,适用于需降低 “漏判正类” 风险的场景(如疾病诊断,避免漏诊)。
F1-Score 2 × (Precision × Recall) / (Precision + Recall) 准确率与召回率的调和平均数,解决二者 “此消彼长” 的矛盾,综合评估模型性能,尤其适用于正负样本不均衡场景。
P-R 曲线 以召回率为横轴、准确率为纵轴绘制的曲线 关键特点:① 召回率增加时,准确率通常下降;② 曲线与坐标轴围成的面积越大,模型综合性能越好;③ 对正负样本不均衡问题敏感(样本不均衡会导致曲线偏移)。
3. 多类别场景评估指标
  • 多类别混淆矩阵:对于 k 分类任务,混淆矩阵为k×k的矩阵,其中元素 Cij 表示 “第 i 类真实样本被模型预测为第 j 类” 的数量。
  • 核心判断标准:矩阵主对角线元素之和为模型正确分类的样本总数,其余元素之和为错误分类的样本总数;主对角线元素值越大,说明对应类别的分类准确率越高,整体模型性能越好。
三、模型基本概念(深度与宽度)

模型的 “深度” 与 “宽度” 是衡量神经网络复杂度的核心指标,文档以经典 LeNet 网络为例进行说明:

  1. 网络的深度

    • 定义:指神经网络中最长路径的卷积层与全连接层数量之和(不包含池化层、归一化层等无参数层)。
    • 示例:LeNet 网络的深度为5 层,具体为 C1(卷积层 1)+ C3(卷积层 2)+ C5(卷积层 3)+ F6(全连接层 1)+ Output(全连接层 2)。
  2. 网络的宽度

    • 定义:指神经网络中每一层的通道数(主要针对卷积层,全连接层以神经元数量近似,但文档中以卷积层通道数为核心)。
    • 示例:LeNet 网络的宽度为:C1 层(6 个通道)、C3 层(16 个通道)。
四、图像分类中样本量过少的问题及解决方案
  1. 样本量过少的问题场景核心原因是样本获取难度大,典型场景包括:

    • 工业产品检测:特殊缺陷产品样本稀缺,需人工筛选或模拟生成。
    • 医疗图像领域:疾病样本受隐私保护、病例数量限制,难以大规模收集。
  2. 两大解决方案

    • 方案 1:迁移学习核心逻辑:利用通用数据集(如ImageNet 数据集,含 1000 个类别、数百万张图像)预训练模型,该模型已学习到通用的图像特征(如边缘、纹理、语义信息),将其迁移到目标任务中,可加速模型收敛,减少对目标任务样本量的依赖。
    • 方案 2:数据增强通过对现有样本进行变换或生成新样本,扩充数据集规模,分为两类:
      增强类型 具体方法
      有监督方法 基于现有样本的简单变换,如平移、水平 / 垂直翻转、亮度调整、对比度调整、随机裁剪、缩放等(不改变样本标签)。
      无监督方法 通过生成模型(如GAN 网络,生成对抗网络)生成与真实样本分布一致的新样本,再用于模型训练(无需人工标注标签)。

4. 关键问题

问题 1:图像分类的 “三层境界”(通用多类别、子类细粒度、实例级)核心区别是什么?分别适用于哪些实际场景?

答案:三者的核心区别在于分类粒度与特征差异要求,具体如下:

  • 通用多类别分类:分类粒度最粗,类别间特征差异大(如飞机与汽车),无需捕捉细微特征;适用于基础图像分类场景,如安防监控中 “人 / 车 / 物” 的区分、垃圾分类(可回收 / 不可回收)。
  • 子类细粒度分类:分类粒度中等,需区分同一大类下的细分类型(如不同品种的狗、不同品牌的手机),类别间特征差异小,依赖模型提取细粒度特征;适用于商品分类(如电商平台 “不同型号的笔记本电脑” 分类)、物种识别(如 “不同种类的鸟类” 识别)。
  • 实例级分类:分类粒度最细,需区分同一物体的不同实例(如同一品牌的两辆汽车、同一只猫的不同照片),需捕捉实例专属的细微特征(如划痕、姿态);适用于个性化场景,如人脸识别(区分不同人)、车辆定损(区分同一车型的不同损伤实例)。
问题 2:在图像分类评估中,精确率(Accuracy)、准确率(Precision)、召回率(Recall)的适用场景有何差异?为什么 F1-Score 更适合正负样本不均衡的场景?

答案

  1. 适用场景差异:
    • 精确率(Accuracy):适用于样本分布均衡的场景,衡量模型整体分类正确性(如 10 类分类中每类样本数量相近),但在正负样本不均衡时(如 99% 为负样本),模型仅预测负类即可获得高 Accuracy,无法反映真实性能。
    • 准确率(Precision):适用于需降低 “假正例” 风险的场景(如垃圾邮件识别),需确保 “预测为垃圾邮件的样本中,真正是垃圾邮件的比例高”,避免正常邮件被误判。
    • 召回率(Recall):适用于需降低 “假反例” 风险的场景(如疾病诊断),需确保 “所有患病样本中,被正确诊断的比例高”,避免漏诊。
  2. F1-Score 适合不均衡场景的原因:正负样本不均衡时,Precision 与 Recall 易出现 “此消彼长”(如提高 Recall 可能导致 Precision 下降),而 F1-Score 是二者的调和平均数,而非算术平均数,能平衡二者权重,避免模型过度偏向某一指标(如仅追求高 Recall 而忽略 Precision),更客观地反映模型在不均衡数据上的综合性能。
问题 3:迁移学习与数据增强在解决 “样本量过少” 问题时,核心逻辑有何不同?分别在什么情况下优先选择其中一种方案?

答案

  1. 核心逻辑差异:
    • 迁移学习:“借力通用特征”,通过通用数据集(如 ImageNet)预训练模型,让模型先学习到通用图像特征(如边缘、纹理),再将这些特征迁移到目标任务中,减少目标任务对样本量的依赖(无需从零开始学习特征)。
    • 数据增强:“扩充样本规模”,通过变换现有样本(有监督)或生成新样本(无监督),直接增加目标任务的样本数量,让模型有更多数据用于学习目标特征(不依赖外部通用特征)。
  2. 优先选择场景:
    • 优先选迁移学习:当目标任务与通用数据集(如 ImageNet)的特征相似度高(如目标任务是 “动物分类”,与 ImageNet 中的动物类别特征重合度高),且目标任务样本量极少(如仅几十张)时,迁移学习可快速提升模型性能,避免数据增强导致的 “样本过拟合”(如过度变换导致样本失真)。
    • 优先选数据增强:当目标任务与通用数据集特征差异大(如医疗图像中的 “肿瘤切片分类”,与 ImageNet 的自然图像特征差异大,迁移学习效果有限),且现有样本具备可变换空间(如通过翻转、裁剪可生成多样本)时,数据增强能更直接地适配目标任务,避免通用特征与目标特征不匹配的问题;若样本量极少先用有监督增强,仍不足则结合 GAN 无监督生成。
Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐