目录

1、偏差(Bias) 和方差(Variance)

1.1.概念

1.2与过拟合欠拟合的关系

高方差 → 过拟合(Overfitting)

高偏差 → 欠拟合(Underfitting)

1.3、解决高方差和高偏差问题

2、迁移学习

2.1概念

​编辑2.2 选择适合的预训练模型

3、准确率和召回率

4、决策树

4.1概念

4.2 熵

4.2.1 熵的定义

4.2.2 熵的计算

4.2.3 条件熵的计算

4.3 决策树的划分选择

4.4 决策树的构建过程

5、回归树

回归树与决策树

1、偏差(Bias) 和方差(Variance)

1.1.概念

我们将数据集通常划分为训练集、验证集、测试集(比例常为7:2:1)

在机器学习中,偏差(Bias) 和 方差(Variance) 是分解模型泛化误差(即模型在未见过的新数据上的预测误差)的两个核心组件,二者共同决定了模型的性能好坏。

通俗来讲:偏差对应 “模型没学会核心规律”,方差对应 “模型学偏了(学了噪声)”。

  • 高偏差的表现:不仅在测试集上预测不准,在训练集上也不准(连 “老师教的内容” 都没学会)。
  • 高方差的表现:在训练集上预测极准(几乎完美拟合每一个训练数据点),但在测试集上预测误差骤升(换个新数据就 “失灵”)。

1.2与过拟合欠拟合的关系

高方差 → 过拟合(Overfitting)

当模型的方差很高时,意味着模型 “学过头了”—— 它不仅学会了训练数据中的核心规律,还把训练集中的 “噪声”(如个别异常数据、随机波动)当成了 “规律”,导致模型在训练集上表现极好,但在测试集上表现极差高方差是导致过拟合的直接原因

高偏差 → 欠拟合(Underfitting)

当模型的偏差很高时,意味着模型连训练数据中的 “核心规律” 都没学会 —— 它过于简单,无法捕捉数据中的复杂模式(比如用线性模型拟合非线性数据)。高偏差是导致欠拟合的直接原因

1.3、解决高方差和高偏差问题

解决高方差(过拟合):思路“降低模型复杂度” 或 “让模型对噪声不敏感

增加训练样本数

减少特征值

增加正则化系数\lambda(通过给模型参数 “加惩罚”,限制参数过大(避免模型为拟合噪声而让参数极端化))

模型剪枝:对决策树、随机森林等模型,删除 “过细的分支”

使用简单模型:直接替换为复杂度更低的模型

解决高偏差(欠拟合):思路“提升模型复杂度” 或 “让模型看到更多规律”

补充关键缺失特征

增加多项式特征值(适用于 “线性模型拟合非线性数据” 的场景)

减小正则化系数\lambda,若系数过大,即使模型本身有能力捕捉规律,也会被惩罚得 “不敢学习”,正则化的惩罚会 “限制模型复杂度”

使用更复杂的模型

延长训练时间 / 调整训练参数(需适当增加训练轮次、调整学习率)

2、数据增强

通过对样本数据进行放大、缩小、翻转、镜像、扭曲(引入网格进行扭曲如下图),对音频数据添加噪声  

数据合成

原来的样本不动,而是增加新的样本

2、迁移学习

2.1概念

在模型预训练时,使用已经经过大规模训练集的模型,即使用别人训练好的开源模型来训练自己的模型。将源模型的最后一层输出改为我们所需的神经元数量,并保持前面的输出参数不变。

2.2 选择适合的预训练模型

要确保任务相关(数据领域和任务类型相似)

数据量与模型规模匹配(如果自身数据集规模较小,选择过于庞大复杂的预训练模型可能导致过拟合)

2.3 机器学习完整周期

确定项目范围——>收集数据——>训练模型(错误分析、改进模型)——>部署系统并进行监护维护(当发现部署有问题时,返回收集数据/训练模型 )

3、准确率和召回率

如上图,用一个四方格对预测值与真实值进行划分:

预测y=1  真实y=1——true positive

预测y=1  真实y=0——false positive

预测y=0  真实y=1——false negative

预测y=0  真实y=0——true negative

准确率 precision =   \frac{true pos}{true pos+false pos}  = \frac{15}{15+5} = 0.75 = 75%

召回率 recall = \frac{true pos}{true pos+false neg} = \frac{15}{15+10} = 0.6 = 60%

准确率P和召回率R均在0-1之间,二者越高越好,但往往是一个高,一个低。因此我们要找到一个平衡二者的函数——Fscore = \frac{1}{\frac{1}{2}(\frac{1}{P}+\frac{1}{R})} = 2\frac{PR}{P+R}

F函数为调和函数,P和R有一个低,就会整体拉低F的值,是一种强调较小值的平均方法。

综上,准确率(P)和召回率(R)通常存在此消彼长的 trade - off,Fscore​作为调和平均能平衡二者,且当P或R较低时,会显著拉低Fscore​,符合调和平均 “强调较小值” 的特点。

在疾病诊断上,漏诊(FN多,R低)和误诊(FP多,P低)都不好,Fscore​可用于平衡这两个指标,选择更合适的模型。

4、决策树

4.1概念

决策树是一种常见的机器学习模型,能够处理分类和回归任务。它的基本思想是以树形结构表示数据的决策过程,通过一系列条件判断逐步缩小目标范围,直到得出结论。

其形状类似二叉树,从根节点出发,每个节点为一个决策点,作为条件判断选择分支。

其本质是从训练集中归纳出一套分类规则。

决策树的构建思路是:当按照某个特征对数据进行划分时,它能最大程度地将原本混乱的结果尽可能划分为几个有序的大类,则就应该先以这个特征为决策树中的根结点。接着,不断重复这一过程,直到整棵决策树被构建完成为止。

如何选择特征作为决策点——引入“熵“的概念

4.2 熵

4.2.1 熵的定义

熵是物体内部的混乱程度。放到决策树中来看,就是使得决策树内的分支尽可能的有序。如下图

熵值越小,表明越有序(如上图的决策树2)

设𝑋 是训练集中的离散随机变量,熵的概率密度为:

    

从该式的定义可以看出,熵仅仅依赖于 𝑋 的概率分布而与其取值无关,所以也可以将 𝑋 的熵记为 𝐻(𝑝)。当某个集合含有多个类别时,此时 𝑘 较大, 𝑝𝑖 的数量过多;且整体的 𝑝𝑖 都会因 𝑘 的过大而普遍较小,从而使得 𝐻(X) 的值过大(𝐻(取负的𝑝𝑖)。这正好符合“熵值越大,事物越混乱”的定义。

4.2.2 熵的计算

例如,现在有两个集合:𝐴 = { 1,2 } , 𝐵 = { 1,2,3,4,5,6 } ,若以这两个集合为取值空间,则可分别计算其熵。
对于集合 𝐴 ,先计算其分布列为:

于是可得到其熵为:

对于集合 𝐵 ,计算其分布列为:

于是可得到其熵为:

结果显示,𝐴 集合的熵值要低一些,从两个集合的内容也能很轻易看出: 𝐴 集合只有两种类别,相对稳定;而 𝐵 集合中的类别过多,显得混乱。熵取到最小值,即表明当前集合状态不混乱,非常有序。

取极端情况,当集合中仅有一类元素时,如 𝐶 = { 1,1,1,1,1,1 } 时,此时其分布列为:

4.2.3 条件熵的计算

在构建决策树时我们可采用一种很简单的思路来进行“熵减”:每当要选出一个内部结点时,考虑样本中的所有“尚未被使用”特征,并基于该特征的取值对样本数据进行划分。即有:

对于每个特征,都可以算出“该特征各项取值对运动会举办与否”的影响(而衡量各特征谁最合适的准则,即是熵)。为此,引入条件熵。首先看原始数据集 𝐷 (共14天)的熵,该数据的标签只有两个(“举办”与“不举办”),且各占一半,故可算出该数据集的初始熵为:

对于每个特征,我们逐个分析,先从“天气”开始:

定义条件熵 𝐻(𝑌 | 𝑋) :在给定 𝑋 的条件下 𝑌 的条件概率分布对 𝑋 的数学期望

4.3 决策树的划分选择

决策树学习的关键在于:如何选择最优划分属性。一般而言,随着划分过程的不断进行,我们自然希望决策树各分支结点所包含的样本尽可能属于同一类别,即结点的 “纯度”越来越高。比较主流的评选算法为:信息增益

信息增益 𝑔(𝐷, 𝑋) :表示某特征 𝑋 使得数据集 𝐷 的不确定性减少程度,定义为集合 𝐷 的熵与在给定特征 𝑋 的条件下 𝐷 的条件熵 𝐻(𝐷 | 𝑋) 之差,即

根据前面的计算结果,可知集合 𝐷 的熵 𝐻(𝐷) = 0.6931 ,特征 “天气”、“温度”、“风速”、“湿度” 的条件熵分别为 𝐻(D | X天气) = 0.3961 、𝐻(D | X温度) = 0.6931、𝐻(D | X风速) = 0.5983、𝐻(D | X湿度) = 0.6315。根据这些数据,可以算出全部特征在被用于分类时,各自的信息增益:

上面各特征求得的信息增益中,“天气” 特征对应的是最大的。也就是说,如果将 “天气” 作为决策树的第一个划分特征,系统整体的熵值将降低 0.297,是所有备选特征中效果最好的。因此,根据 “学校举办运动会的历史数据” 构建决策树时,根节点最好取 “天气” 特征。

接下来,在 “晴天” 中的数据将按上面的流程继续执行,直到构建好一棵完整的决策树(或达到指定条件)。

4.4 决策树的构建过程

通过构建较小的子决策树来递归实现。当熵值<某阈值时/信息增益很小时,可停止分裂构建。

当处理多个特征值时,可采用独热编码的分类特征,将不同特征值均用0/1来表示,样本符合特征的为1,不符合为0.

5、回归树

决策树(Decision Tree)是一个广义概念,而回归树(Regression Tree)是决策树的一个重要分支是决策树在 “回归任务” 中的具体实现.

回归树:本质是用树结构预测连续值,每个叶子节点对应一个 “数值输出”(而非类别)。

回归树与决策树

笔记参考博主:theSerein

【机器学习】决策树(理论)-CSDN博客

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐