第一部分:三大学习范式

1. 监督学习
  • 核心思想:模型从已标注的数据中学习。数据集中每个样本都包含输入特征和对应的正确输出(标签)。

  • 目标:学习一个从输入到输出的映射函数,以便对新的、未见过的数据做出准确的预测。

  • 类比:就像一个有答案的学生在做练习题。通过对比自己的答案和标准答案,学习如何解题。

  • 典型任务

    • 分类:预测离散的类别标签。例如:垃圾邮件识别(垃圾邮件/非垃圾邮件)、图像识别(猫/狗)。

    • 回归:预测连续的数值。例如:预测房价、预测销售额。

  • 常用算法:线性回归、逻辑回归、支持向量机(SVM)、决策树、随机森林、神经网络。

2. 无监督学习
  • 核心思想:模型从未标注的数据中学习,即只有输入特征,没有给定的输出标签。

  • 目标:发现数据内部隐藏的结构、模式或关系。

  • 类比:就像一个学生在没有任何提示的情况下,自己将一堆不同的水果按形状或颜色进行分类。

  • 典型任务

    • 聚类:将数据分成不同的组(簇),使得同一组内的数据点彼此相似。例如:客户细分、新闻主题分组。

    • 降维:在尽可能保留关键信息的前提下,减少数据的特征数量。例如:数据可视化、去除冗余特征。

    • 关联规则学习:发现数据中不同特征之间的关联关系。例如:“购物篮分析”(买尿布的顾客也常买啤酒)。

  • 常用算法:K-Means聚类、主成分分析(PCA)、自编码器。

3. 强化学习
  • 核心思想:一个智能体环境中通过试错来学习。它根据当前状态采取行动,环境会给予一个奖励(正或负)作为反馈。

  • 目标:学习一个策略,使得智能体在一系列行动后能获得累积奖励的最大化

  • 类比:训练小狗做动作。它做出一个动作(如坐下),如果做对了就给它零食(正奖励),做错了就不给或轻微惩罚(负奖励)。小狗通过不断尝试来学会哪个动作能获得奖励。

  • 典型任务:围棋/象棋AI、机器人控制、自动驾驶、游戏AI(如AlphaGo)。

  • 核心概念:智能体、环境、状态、动作、奖励、策略。

小结对比

学习类型 数据要求 目标 典型任务
监督学习 带标签的数据 预测、分类、回归 房价预测、图像分类
无监督学习 无标签的数据 发现内在结构 客户细分、数据压缩
强化学习 与环境的交互 最大化长期奖励 游戏AI、机器人控制

第二部分:模型评估与优化

1. 过拟合 vs. 欠拟合
  • 欠拟合

    • 表现:模型在训练集测试集上都表现得很差。

    • 原因:模型过于简单,无法捕捉数据中的基本特征和规律。

    • 类比:用一条直线去拟合一个弯曲的抛物线,无论如何都拟合不好。

  • 过拟合

    • 表现:模型在训练集上表现非常好(甚至完美),但在测试集上表现很差。

    • 原因:模型过于复杂,不仅学习了数据的普遍规律,还学习了训练数据中的噪声和随机波动。导致泛化能力差。

    • 类比:为了记住所有练习题(包括其中的印刷错误),而不是学习解题的通用方法,导致遇到新题就不会做。

2. 偏差与方差权衡

这是理解过拟合和欠拟合的深层理论。

  • 偏差:模型预测值与真实值之间的平均差异。高偏差意味着模型过于简单,忽略了数据的相关特征(导致欠拟合)。

  • 方差:模型预测值的波动程度。高方差意味着模型过于复杂,对训练数据中的微小变化过于敏感(导致过拟合)。

  • 权衡:模型的复杂度增加时,偏差会减小(拟合得更好),但方差会增大(更敏感)。我们的目标是找到最佳复杂度,使得总误差(偏差² + 方差 + 不可减少误差) 最小。

3. 正则化
  • 目的:一种用于防止过拟合(降低方差)的技术。

  • 核心思想:在模型的损失函数中增加一个惩罚项,用于惩罚过大的模型参数(权重),从而限制模型的复杂度,迫使模型变得简单、平滑。

  • 常见类型

    • L1正则化(Lasso):惩罚项的权重是绝对值之和。倾向于产生稀疏权重,即会将一些不重要的特征权重降为0,可用于特征选择。

    • L2正则化(Ridge):惩罚项的权重是平方和。倾向于让权重值变小且分布均匀,但不会为0。

4. 交叉验证
  • 目的:一种更鲁棒、更有效地评估模型泛化能力调整超参数的方法。

  • 核心思想:将训练数据多次划分为新的训练子集和验证子集,多次训练和评估,以平均性能作为模型好坏的标准。

  • 最常见方法:k折交叉验证

    1. 将训练集随机分成k个大小相似的子集(或称“折”)。

    2. 轮流使用其中k-1折数据训练模型,用剩下的1折数据验证模型。

    3. 重复k次,每次使用不同的子集作为验证集。

    4. 最终得到k个性能评估结果,取其平均值作为模型性能的指标。

    • 优点:充分利用数据,评估结果更稳定,减少了因单次数据划分不合理而带来的偏差。


第三部分:评估指标(主要用于分类问题)

首先需要理解混淆矩阵,它是所有指标的基础。
对于一个二分类问题:

预测为正例 预测为负例
实际为正例 True Positive (TP) False Negative (FN)
实际为负例 False Positive (FP) True Negative (TN)
1. 准确率
  • 公式(TP + TN) / (TP + TN + FP + FN)

  • 含义:所有预测正确的样本占总样本的比例。

  • 缺点:在数据不平衡(例如99%是负例,1%是正例)时,一个总是预测为负例的模型准确率也能达到99%,但这个模型毫无用处。

2. 精确率
  • 公式TP / (TP + FP)

  • 含义:在所有被预测为正例的样本中,真正是正例的比例。

  • 关注点:预测的准不准。即“宁缺毋滥”。适用于重视准确性的场景,如垃圾邮件判定(把正常邮件判为垃圾邮件的代价很高)。

3. 召回率
  • 公式TP / (TP + FN)

  • 含义:在所有实际为正例的样本中,被成功预测为正例的比例。

  • 关注点:预测的全不全。即“宁可错杀一千,不可放过一个”。适用于重视全面性的场景,如疾病诊断(漏掉一个病人的代价很高)。

4. F1-Score
  • 公式2 * (Precision * Recall) / (Precision + Recall)

  • 含义:精确率和召回率的调和平均数

  • 用途:当一个模型需要同时兼顾精确率和召回率时,F1是一个很好的综合指标。尤其在数据不平衡时比准确率更有用。

5. ROC曲线与AUC
  • ROC曲线:Receiver Operating Characteristic曲线。

    • 横轴:假正率 FPR = FP / (FP + TN)(实际为负的样本中被误判为正的比例)。

    • 纵轴:真正率 TPR = Recall = TP / (TP + FN)

    • 绘制过程:通过不断调整模型判断正负例的阈值,得到一系列(FPR, TPR)点,连接这些点形成曲线。

  • AUC:Area Under the ROC Curve,即ROC曲线下的面积。

    • 含义:AUC值可以解释为:随机给定一个正例和一个负例,模型对正例的评分高于负例的概率。

    • 范围:在0.5到1之间。

    • 解读

      • AUC = 0.5:模型没有区分能力,等同于随机猜测。

      • AUC 越接近 1:模型的性能越好,区分正负例的能力越强。

    • 优点:对类别不平衡不敏感,是评估分类器整体性能的非常常用的指标。

希望这份详细的梳理能帮助您更好地理解这些机器学习的基础核心概念!

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐