摘要

今天学习了高斯分布(正态分布)在异常检测中的应用。通过回顾高斯分布的基本概念,我理解了均值μ决定分布中心位置,标准差σ控制曲线宽度的特性。在异常检测中,我们利用高斯分布建立概率模型,计算新样本的概率密度,当p(x)低于阈值ε时判定为异常。这种方法能够有效识别与正常模式显著偏离的数据点。

Abstract

Today’s lesson focused on the application of Gaussian distribution (normal distribution) in anomaly detection. By reviewing fundamental concepts of Gaussian distribution, I understood how the mean μ determines the center position and the standard deviation σ controls the curve width. In anomaly detection, we use Gaussian distribution to build probability models and compute probability density for new samples. When p(x) falls below a threshold ε, the sample is identified as an anomaly. This method effectively detects data points that significantly deviate from normal patterns.

高斯正态分布

为了进行异常检测,我们需要使用高斯分布,也称为正态分布,所以当我们听到说高斯分布或正态分布,它们实际上是同一个东西

在这里插入图片描述
高斯分布我们之前肯定学习过,这里只简单地回顾一些关键点
σ被称为标准差,而σ的平方被称为分布的方差
这条曲线显示的是p(x)或x的概率

在这里插入图片描述
这个μ是高斯分布曲线的中心,而曲线的宽度由参数σ决定,让我们看看几个例子来看看μ和σ如何影响高斯分布

在这里插入图片描述
首先先看这个非常标准的高斯分布曲线,μ = 0 作为这个曲线的中心,但是当我们看到下一个图像时

在这里插入图片描述

σ被改成了0.5,它变成了一个更窄的曲线了,但是我们直到,概率总和始终为1,所以高斯分布曲线的面积始终为1,这就是为什么当σ变小时,这个曲线会被拔高

在这里插入图片描述
按照我们刚才分析的结果,当宽度变宽时,这个曲线的高度就应该降低,始终牢记p(x) = 1就可以了

在这里插入图片描述
这个图变化的原因是μ改变了,因为μ是曲线的中心,所以改变了μ,曲线的位置随之改变

让我们回到刚才的例子,这里有些例子,它们组合后的高斯分布是这样的

在这里插入图片描述
我们可以计算μ和σ的平方,我们对μ的估计是所有重新训练样本的平均值,即

在这里插入图片描述
在这里插入图片描述
假设现在有个例子在这里
在这里插入图片描述
有图可知它的p(x)很高,说明这个样本是没有问题的

在这里插入图片描述

但是我们看到左边这个样本,它的p(x)很小并且它与其他样本格格不入,说明这个样本是有问题的

总结

今天的学习让我掌握了基于高斯分布的异常检测原理。通过具体的图示和公式,我清晰理解了μ和σ如何影响分布形状,以及如何从训练数据中估计这两个参数。最重要的是,我学会了如何用概率密度来判断样本是否异常——那些落在分布边缘、概率很低的点就是我们需要关注的异常点。这种方法的巧妙之处在于它用概率来量化"正常"的范围,为异常检测提供了数学依据。相比之前凭直觉判断哪些点不正常,现在有了更系统的方法论。这为后续实际应用异常检测算法打下了坚实基础。

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐