机器学习(7):降维
(二)降维
-
定义
保留数据的核心结构,将高维数据转化为低维空间显示。
-
目的:
-
数据压缩和加速学习:使用较少的存储空间和计算开销,降低损耗,加速算法学习。
-
避免“维度灾难”:高维空间中数据容易变得极为稀疏,距离度量失效,导致模型性能下降。
-
可视化:使得复杂多维降至2-3维进行可视化
-
避免过拟合:通过简化模型(例如减少训练数据中的属性数量),降低模型复杂度,从而减少过拟合的风险
-
-
算法类型
-
线性降维方法:这类方法假设数据存在线性结构,通过线性变换将数据投影到低维空间。
-
非线性降维方法:这类方法适用于数据存在非线性结构的情况,能够捕获数据中的复杂非线性关系。
|
类型 |
算法 |
原理 |
优势 |
劣势 |
适用范围 |
|---|---|---|---|---|---|
|
线性 |
主成分分析(PCA) |
通过线性变换找到一组新的正交坐标轴(主成分),使得数据在这些新坐标轴上的投影方差最大化。 |
|
|
线性数据降维、去噪 |
|
线性判别分析 (LDA) |
最大化类间距离,同时最小化类内方差。 |
|
|
分类任务降维 | |
|
因子分析 (FA) |
假设数据由潜在因子生成,目标是找到这些因子来解释观测数据的相关性。 |
|
|
潜在变量建模 | |
|
多维缩放 (MDS) |
在降维后的低维空间中,尽可能地保持原始高维空间中样本点之间的距离关系(或相似性) |
|
|
距离保持降维 | |
|
非线性 |
核主成分分析(KPCA) |
将数据映射到高维空间再进行线性PCA |
能处理复杂非线性结构 |
计算量大,参数敏感 |
数据有明显非线性模式,需要提取非线性主成分 |
|
t-SNE |
保持高维和低维的局部相似性概率分布 |
可视化效果极佳,善于保持局部结构 |
计算开销大,不保留全局结构 |
| |
|
均匀流形近似与投影(UMAP) |
基于拓扑流形理论,假设数据在局部是均匀分布的 |
|
|
| |
|
局部线性嵌入(LLE) |
保持局部的线性重构关系 |
计算相对高效,保持局部线性特征 |
对邻居数k敏感,要求数据密度均匀 |
|
更多推荐



所有评论(0)