深度学习基础:从线性回归到Softmax分类
一、线性回归
线性回归是深度学习中最基础的模型之一,常用于预测连续值。例如,在房价预测中,我们可以根据房屋的特征(如面积、位置等)估计其价格。
关键概念:
神经网络结构:输入层 → 输出层(单输出)
损失函数:常用均方误差(MSE)衡量预测值与真实值的差距
优化算法:通过梯度下降法最小化损失函数,调整模型参数(权重和偏置)
梯度下降法:
梯度指向函数值下降最快的方向
通过反复沿梯度反方向更新参数,逐步逼近最优解
学习率是关键超参数:太小收敛慢,太大可能震荡甚至发散
小批量随机梯度下降(Mini-batch SGD):
深度学习中默认的优化算法
平衡计算效率与收敛稳定性
批量大小(batch size)是另一个重要超参数
二、从回归到分类:Softmax回归
Softmax回归用于多类别分类问题,如图像分类、文本分类等。
应用场景:
MNIST手写数字识别(10类)
ImageNet图像分类(1000类)
Kaggle上的蛋白质图像分类(28类)、恶意评论分类(7类)
模型结构:
输出层神经元数 = 类别数
每个输出表示对应类别的置信度
通过Softmax函数将输出转换为概率分布(非负、和为1)
Softmax运算:
使用指数函数确保输出非负
归一化后得到概率分布
例如:[1, -1, 2] → [0.26, 0.04, 0.70]
损失函数:
交叉熵损失(Cross-Entropy Loss)常用于分类问题
衡量预测概率分布与真实分布之间的差异
三、总结
线性回归用于回归任务,输出连续值;
Softmax回归用于多分类任务,输出概率分布;
梯度下降及其变体(如SGD)是优化模型参数的核心方法;
学习率和批量大小是训练过程中需要精心调节的超参数;
交叉熵损失是分类任务中常用的损失函数。
更多推荐



所有评论(0)