深度学习基础核心内容

本文系统梳理从神经网络基础理论、模型训练优化,到分类任务应用及损失函数细节的关键知识点,为入门者构建清晰的知识框架。

一、神经网络基础与模型训练核心

本次会议聚焦神经网络的“源头”理论——从线性回归切入,延伸至激活函数的必要性、损失函数定义及梯度下降优化方法,奠定深度学习模型的基础逻辑。

1. 线性回归与神经网络结构关联

  • 线性回归核心:通过公式 Y = WX + b 实现数据预测。其中,权重 W 反映各特征对预测结果的重要性,偏置项 b 用于调整预测基准(抵消特征加权求和的偏移)。
  • 神经网络的简化形式:将线性回归模型直接应用于神经网络,形成“输入层-输出层”的最简结构(无隐藏层),其核心计算仍为线性操作;复杂网络则在此基础上增加“隐藏层”,形成“输入层-隐藏层-输出层”的标准架构。

2. 激活函数:打破线性约束的关键

  • 核心问题:单纯的线性计算(如多层线性叠加仍为线性)使神经网络仅能解决线性可分问题,无法处理图像、文本等非线性数据。
  • 解决方案:在网络每层计算后叠加激活函数,打破线性约束。典型案例为 ReLU(修正线性单元) 函数:输入>0时保持原值,输入≤0时置为0。该设计不仅解决非线性问题,还简化负值计算,降低模型运算量。
  • 设计灵感:类比生物神经元——接收突触信号后,仅当信号强度超过阈值时才产生响应,激活函数同理筛选并转换“有效信号”。

3. 损失函数与梯度下降:模型训练的“指挥棒”

  • 损失函数:量化模型预测值与真实值的差距,是模型优化的目标。针对回归问题,常用 均方误差(MSE),训练目标即最小化MSE。
  • 梯度下降核心原理:自动寻找使损失函数最小化的参数(W和b),步骤如下:
    1. 计算损失函数对各参数的梯度(梯度方向是函数值增加最快的方向);
    2. 沿梯度反方向更新参数(此方向为函数值减小最快的方向);
    3. 按预设学习率(步长) 迭代更新,逐步逼近损失函数的极小值点。

4. 小批量随机梯度下降(Mini-batch SGD)

  • 应用背景:全量数据(Batch GD)计算梯度时,数据量庞大导致计算成本高、效率低,不适用于大规模数据集。
  • 核心方案:每次迭代从全量数据中随机抽取一小批样本(Batch Size为B),用这批样本的梯度近似全量数据梯度,更新模型参数。
  • 核心优势:①大幅降低计算负担,提升训练速度;②样本随机性帮助模型跳出局部最优解,优化最终性能。

二、超参数、分类任务与Softmax回归

本次会议在第一次会议基础上,聚焦“分类任务”这一核心应用场景,深入讲解Softmax回归的原理、分类与回归的差异,同时补充超参数与独热编码的关键知识。

1. 梯度下降延伸与超参数定义

  • 梯度下降回顾:核心思想仍是“沿梯度反方向更新参数,最小化损失函数”,其中小批量随机梯度下降是深度学习的主流优化算法。
  • 超参数概念:训练前需人工设定的参数(非模型自动学习),其中 Batch Size学习率(LR) 是最关键的两个:
    • Batch Size过大:占用过多计算资源,易陷入局部最优;
    • Batch Size过小:无法充分利用并行计算资源,训练波动大。

2. Softmax回归:分类任务的核心工具

  • Softmax函数特性:输出向量中所有元素之和为1,因此每个元素可解释为“样本属于对应类别的概率(置信度)”。
  • 分类应用逻辑:取输出向量中置信度最高的元素对应的类别,作为模型的预测结果。典型应用场景包括手写数字识别(MNIST数据集)、图像分类(ImageNet数据集)等多分类任务。
  • 全连接层的作用:分类网络的末尾通常设置全连接层,其功能是将隐藏层输出的特征“汇总”到每个类别对应的输出节点上,为Softmax计算提供输入。

3. 回归任务与分类任务的核心差异

任务类型 目标输出 典型模型
回归任务 连续数值(如房价、温度) 线性回归
分类任务 离散类别标签(如“猫/狗”“数字0-9”) 含Softmax的神经网络

4. 独热编码(One-Hot Encoding):分类标签的数值转换

  • 核心作用:将非数值型的类别标签(如“红色”“蓝色”)转换为模型可处理的数值向量。
  • 编码规则:为每个类别分配一个独立的维度,向量中仅对应“当前类别”的维度值为1,其余维度均为0。例如,类别“猫/狗/鸟”可编码为 [1,0,0]、[0,1,0]、[0,0,1]。
  • 关键优势:避免模型错误感知类别间的“大小关系”(如若用1/2/3表示上述类别,模型可能误认为“鸟>狗>猫”),保证类别间的独立性。

5. 常见损失函数补充

会议补充了两种基础损失函数,为后续训练机制铺垫:

  • 均方误差(Square Loss / L2 Loss):适用于回归任务,计算预测值与真实值差值的平方均值;
  • 绝对误差(L1 Loss):同样适用于回归任务,计算预测值与真实值差值的绝对值均值,对异常值的鲁棒性强于L2 Loss。

三、典型损失函数与梯度方向解析

本次会议聚焦损失函数的细节,深入讲解三种核心损失函数(L2、L1、交叉熵)的特性,明确“梯度反方向是损失函数下降方向”的核心规律。

核心结论:梯度反方向的统一意义

所有损失函数的优化逻辑一致:梯度的反方向是损失函数值下降最快的方向,沿此方向更新参数可逐步逼近损失函数的极小值点(最优解)。

1. L2损失(均方误差)

  • 梯度方向特性:其梯度反方向精准指向损失函数的最低点,该最低点对应数据的“中心点”(即所有样本的均值附近)。
  • 适用场景:回归任务中最常用,对小误差敏感,但对异常值敏感(异常值会导致误差平方增大,影响参数更新)。

2. L1损失(绝对误差)

  • 梯度方向特性:梯度反方向同样指向损失函数的最低点,该最低点位于数据的“中心点附近”(更接近中位数,对异常值鲁棒)。
  • 适用场景:回归任务中,当数据存在较多异常值时,L1 Loss比L2 Loss更稳定(异常值的绝对误差影响小于平方误差)。

3. 交叉熵损失(Cross-Entropy Loss)

  • 梯度方向特性:梯度反方向直接指向模型的最优解,能快速引导参数向“降低类别预测误差”的方向更新,收敛速度快于L2/L1 Loss。
  • 适用场景:分类任务的核心损失函数(常与Softmax回归搭配使用),通过量化“预测概率分布”与“真实标签分布”的差距,优化分类准确率。
Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐