深度学习中的多准则优化:原理、架构与实验结果

1. 引言

人工智能(AI)是一个跨学科领域,融合了生物学、计算机科学、哲学、数学、工程学、机器人学和认知科学,旨在利用计算机技术模拟人类智能。机器学习(ML)作为AI的分支,专注于从数据中学习的算法,以进行未来预测和判断。ML算法主要分为监督学习和无监督学习。监督学习通过标记的训练数据和输入 - 输出对来学习未知函数;无监督学习则用于发现未标记数据集中的潜在模式和信息。

近年来,深度学习(DL)算法在监督学习任务(如图像分类和自然语言处理)中成为了最先进的技术。DL是ML的一个分支,它使用人工神经网络(ANNs)从数据中学习高级抽象。ANNs主要有三种类型:
- 前馈神经网络:是最简单的神经网络类型,数据从输入层进入,经隐藏层转换,最后由输出层产生所需输出。
- 循环神经网络:网络中存在循环,能够记住先前的输入,适用于时间序列数据或顺序重要的数据。
- 卷积神经网络:专为处理图像而设计,能够从图像中学习特征并将其推广到新图像。

当前许多DL应用需要大量训练,但分布式系统中的本地规则对数据传输施加了严格限制,因此提出了联邦学习(FL)的概念。FL是一种分布式学习技术,可在分散的大量数据上进行模型训练。然而,数据分散在多个节点上,决策者需要处理相互竞争的节点目标和潜在的恶意威胁。

多准则优化(MOP)是运筹学和决策制定的一个分支,用于研究具有多个(通常相互矛盾)准则的优化模型。在过去50年里,越来越多的研究人员致力于此领域,开发了多种方法和策略,应用于经济学、工程学、金融学和管理学等多个领域。MOP决策问题计算量大且评估困难,但通常能带来更明智和更好的决策。

将MOP应用于DL以实现多数据集学习是一个新兴且未充分探索的研究领域。随着边缘计算(EC)和物联网(IoT)的兴起,对这类应用的需求显著增加。为实现此类应用,提出了一种创新且严谨的实用技术,该技术综合了数据拟合项、熵和未知参数集的稀疏性三个不同准则。

2. 深度学习

DL是ML的一个子领域,它自动评估数据并将其转化为规则,供计算机用于生成预测。与传统ML相比,DL采用更复杂的算法设计,即ANNs。ANNs由许多相互连接的处理节点或神经元组成,能够学习识别数据中的复杂模式,广泛应用于图像识别和分类、模式识别以及时间序列预测等领域。

2.1 深度学习的起源

DL的起源可以追溯到40年代至60年代的控制论领域。控制论是一个跨学科领域,研究复杂系统的结构,由Norbert Wiener首次提出。后来,多个科学家进一步发展了控制论,但在50年代受到了AI社区的批评,一些科学家认为其思想过于宽泛且缺乏重点。60年代,受大脑信息处理方式启发的连接主义方法应运而生,由David Rumelhart、James McClelland和Geoffrey Hinton等人开发。DL借鉴了连接主义,其灵感来自大脑的结构和功能。

2.2 深度学习的发展历程

  • 感知机 :50年代末,Frank Rosenblatt提出了感知机,它是单层神经网络,可用于线性分类任务,是现代DL算法的前身。70年代,Bernard Widrow和Ted Hoff引入了误差反向传播的思想,用于训练神经网络,该算法至今仍在许多现代DL架构中使用。
  • 多层感知机(MLP) :80年代,Geoffrey Hinton、David Rumelhart和Ronald Williams引入了MLP。MLP由多层人工神经元组成,是许多任务(包括计算机视觉和自然语言理解)中的常用架构。即使在引入40年后,MLP仍然在不同领域有广泛应用。MLP由多个层组成,隐藏层位于输入层和输出层之间,没有隐藏层的MLP不属于DL范畴。例如,逻辑回归模型和线性回归模型就不是DL架构。MLP在乳腺癌检测、食品产量预测和陶瓷绝缘子分类等领域都取得了良好的效果。
  • 卷积神经网络(CNN) :CNN的概念最初源于Neocognitron,首次实现用于数字识别的CNN是由Yann LeCun等人提出的。卷积操作是信号处理和计算机视觉技术中的基本操作,对于CNN,卷积操作将输入特征矩阵与核矩阵进行卷积,得到更紧凑的表示。CNN主要用于图像分类,因为它依赖于ANN架构中像素的局部依赖性,在某些情况下,CNN的性能优于标准MLP。例如,在乳腺癌预测和医学图像识别中,CNN都取得了比MLP更高的准确率。此外,CNN也可用于处理表格数据。
  • 残差网络(ResNet) :随着对ANNs和DL的兴趣增加以及硬件能力的提升,网络变得非常深,导致了梯度消失问题。为解决这一问题,Kaiming He等人提出了ResNet。ResNet由一系列层组成,其中一些层是恒等映射,通过捷径连接改变了标准MLP的公式,允许梯度在某些层中不受影响地流动,从而解决了梯度消失问题。ResNet在多个图像分类任务中被证明是一种简约而有效的架构。

2.3 深度学习架构对比

架构类型 特点 适用场景 优势 劣势
前馈神经网络 结构简单,数据单向流动 简单的分类和回归问题 易于理解和实现 难以处理复杂的序列和空间信息
循环神经网络 具有记忆功能,能处理序列数据 时间序列分析、自然语言处理 考虑数据的顺序信息 训练困难,存在梯度消失或爆炸问题
卷积神经网络 利用卷积操作提取特征 图像和视频处理 减少参数数量,提高计算效率 对非结构化数据处理能力有限
残差网络 通过捷径连接解决梯度消失问题 深度神经网络训练 可以训练更深的网络,提高模型性能 模型复杂度较高,计算资源需求大

3. 模型公式化

大多数数据拟合技术可以抽象地总结为以下问题:设$(X, d_X)$和$(Y, d_Y)$是两个度量空间,$\Lambda \subset R^n$是一个紧凑的参数集。考虑一组输入向量$x_i$和标签$y_i$($i = 1, …, N$),一个黑盒函数$f: X \times \Lambda \to Y$,以及以下数据拟合/最小化问题:
$$\min_{\lambda \in \Lambda} DFE(\lambda) := (d_Y(f(x_1, \lambda), y_1), d_Y(f(x_2, \lambda), y_2), …, d_Y(f(x_N, \lambda), y_N))$$

函数$DFE(\lambda)$具有以下性质:
- $DFE(\lambda): \Lambda \to R^N_+$
- 如果函数$f(x, \cdot)$是连续的,那么$DFE$在$\Lambda$上连续,因此$DFE$至少有一个全局帕累托有效解。
- 如果存在$\lambda^ \in \Lambda$使得$DFE(\lambda^ ) = 0$,那么$\lambda^ $是一个理想(也是有效)点,此时$f(x_i, \lambda^ ) = y_i$,对应于$f(\cdot, \lambda^*)$将$x_i$精确映射到$y_i$的理想情况。

为简化向量值问题的复杂性,可使用权重进行标量化。设$\beta_i \geq 0$($i = 1, …, N$)是一组权重,将问题标量化为:
$$\min_{\lambda \in \Lambda} \beta \cdot DFE(\lambda) := \sum_{i = 1}^{N} \beta_i d_Y(f(x_i, \lambda), y_i)$$

通过指定$d_Y$和$f$的形式,并采用线性标量化方法,可以得到经典的回归模型:
- 当$f(x, \lambda) = \lambda \cdot x$,$d_Y(f(x_i, \lambda), y_i) = (\lambda \cdot x_i - y_i)^2$,且标量化系数$\beta_i = \frac{1}{N}$时,得到均方误差:
$$\min_{\lambda \in \Lambda} \beta \cdot DFE(\lambda) := \frac{1}{N} \sum_{i = 1}^{N} (\lambda \cdot x_i - y_i)^2$$
- 当$y_i \in {-1, 1}$,$d_Y(f(x_i, \lambda), y_i) = \varphi(f(x_i, \lambda) y_i)$(其中$\varphi(u) = \ln(1 + e^{-u})$),且$\beta_i = \frac{1}{N}$时,得到逻辑回归模型:
$$\min_{\lambda \in \Lambda} \beta \cdot DFE(\lambda) := \frac{1}{N} \sum_{i = 1}^{N} \ln(1 + e^{-f(x_i, \lambda) y_i})$$
- 当$y_i \in {0, 1}$,$d_Y(f(x_i, \lambda), y_i) = - \sum_{i = 1}^{N} [y_i \log(f(x_i, \lambda)) + (1 - y_i) \log(1 - f(x_i, \lambda))]$,且$\beta_i = \frac{1}{N}$时,得到带缩减的二元交叉熵损失:
$$\min_{\lambda \in \Lambda} \beta \cdot DFE(\lambda) := - \frac{1}{N} \sum_{i = 1}^{N} [y_i \log(f(x_i, \lambda)) + (1 - y_i) \log(1 - f(x_i, \lambda))]$$

该模型考虑了三个不同的准则:向量值的$DFE(\lambda)$、熵$ENT(\lambda)$和向量$\lambda$的稀疏性$SP(\lambda)$。在实际应用中,通常希望找到“简单”的最优解,即具有最少非零分量或不稀疏的解。稀疏性的概念常用于降低模型的复杂性,只考虑那些对解有重要影响的参数。

为衡量解的稀疏性,引入了$\ell_0$伪范数:
$$|\lambda| 0 = #{i : \lambda_i \neq 0}$$
但基于$\ell_0$伪范数的优化问题通常是组合问题,一般为NP - 难问题。为克服这些困难,常用$\ell_1$范数作为凸替代:
$$|\lambda|_1 = \sum
{i = 1}^{n} |\lambda_i|$$
或者使用近似函数:
$$|\lambda| * = \sum {i = 1}^{n} (1 - e^{-\alpha \lambda_i^2})$$
其中$\alpha > 0$。将向量值训练算法扩展为包含稀疏性准则:
$$\min_{\lambda \in \Lambda} (DFE(\lambda), SP(\lambda))$$

学习多个分布式数据集具有诸多优势,如提高泛化能力、降低过拟合敏感性和增强鲁棒性。可以同时从不同数据集学习,平衡从每个数据集提取的信息,减少训练过程中的偏差。对于多个数据集$\Gamma_1, \Gamma_2, …, \Gamma_M$,每个数据集的基数为$s_i$,训练过程可表示为:
$$\min_{\lambda \in \Lambda} DFE(\lambda) := (DFE_1(\lambda), …, DFEM(\lambda))$$
其中$DFE_1: \Lambda \to R^{s_1}, …, DFEM(\lambda): \Lambda \to R^{s_M}$是在每个数据集$\Gamma_i$上定义的数据拟合项。

解决上述模型的一种方法是采用线性标量化方法,设$\beta_i \in R^{s_i} +$($i = 1, …, M$)是与每个准则相关的权重,标量化模型为:
$$\min
{\lambda \in \Lambda} \beta_1 \cdot DFE_1(\lambda) + \cdots + \beta_M \cdot DFEM(\lambda)$$

3.1 模型公式化流程

graph TD
    A[定义度量空间和参数集] --> B[确定输入向量和标签]
    B --> C[定义黑盒函数]
    C --> D[构建数据拟合/最小化问题]
    D --> E[分析函数性质]
    E --> F[进行标量化处理]
    F --> G[得到经典回归模型]
    G --> H[考虑稀疏性准则]
    H --> I[扩展到多数据集学习]
    I --> J[采用线性标量化方法求解]

4. 结果

通过计算实验探索了DL和MOP结合的影响,特别是在图像识别任务中。选择了MLP、CNN和ResNet三种不同的ANN架构,并考虑了有无L1范数正则化的情况。

4.1 数据集

使用MNIST数据集,它是一组手写数字图像,由Yann LeCun最初提出,已成为手写数字识别的事实上的标准。该数据集包含60,000个训练图像和10,000个测试图像,图像为28×28像素,每个图像有一个标签表示其所代表的数字。将数据集$\Gamma$划分为三个子集$\Gamma_1, \Gamma_2, \Gamma_3$,每个子集的数据量相同。$\Gamma_1$是原始数据的未修改部分,$\Gamma_2$和$\Gamma_3$的数据分别添加了零均值高斯噪声,标准差分别为$\sigma_2$和$\sigma_3$。

4.2 损失函数

在多数据集学习中,要最小化的标量化多准则损失函数为:
$$\min_{\lambda \in \Lambda} \beta_1 \frac{DFE_1}{s_1}(\lambda) + \beta_2 \frac{DFE_2}{s_2}(\lambda) + \beta_3 \frac{DFE_3}{s_3}(\lambda)$$
其中$\beta_i$是与第$i$项相关的权重,$DFE_i / s_i$是使用数据集$\Gamma_i$定义的数据拟合函数。设定重要参数$\beta = \frac{1}{3}$,并引入扰动参数$\varepsilon$进行实验:
$$\min_{\lambda \in \Lambda} (\frac{1}{3} + \varepsilon) \frac{DFE_1}{s_1}(\lambda) + (\frac{1}{3} - \frac{\varepsilon}{2}) \frac{DFE_2}{s_2}(\lambda) + (\frac{1}{3} - \frac{\varepsilon}{2}) \frac{DFE_3}{s_3}(\lambda)$$
当$\varepsilon = 0$时,得到基本公式。将$DFE_i / s_i$设置为交叉熵损失:
$$DFE_i / s_i(\lambda) = \frac{1}{s_i} \sum_{j = 0}^{s_i} \sum_{k = 1}^{K} [y^{(k)} j \log((h {\lambda}(x_j)) k) + (1 - y^{(k)}_j) \log(1 - (h {\lambda}(x_j))_k)]$$

为考虑稀疏性,在数据拟合损失函数中加入L1范数:
$$\min_{\lambda \in \Lambda} (\frac{1}{3} + \varepsilon) \frac{DFE_1}{s_1}(\lambda) + (\frac{1}{3} - \frac{\varepsilon}{2}) \frac{DFE_2}{s_2}(\lambda) + (\frac{1}{3} - \frac{\varepsilon}{2}) \frac{DFE_3}{s_3}(\lambda) + \beta_4 |\lambda|_1$$

4.3 实验结果

  • MLP架构 :MLP架构由输入层(包含784个节点)、隐藏层(包含25个节点)和输出层(包含10个节点)组成。节点的激活函数使用sigmoid函数:
    $$h_{\lambda}(x_j) = \frac{1}{1 + e^{\lambda^T x_j}}$$
    实验结果表明,随着扰动参数$\varepsilon$在区间$[0.001, 0.01]$上均匀变化,与基准情况($\varepsilon = 0$)相比,使用多准则方法确实可以提高模型性能。同时,随着L1正则化程度的增加,准确率会下降,但即使允许稀疏性,应用MOP技术在学习过程中仍然有改进。
  • ResNet架构 :在ResNet架构中,扁平化的输入图像通过由整流激活函数介导的前两层,然后添加跳过连接以防止梯度消失。使用与MLP实验相同的成本函数,实验结果与MLP架构的结果一致,即即使在训练过程中考虑稀疏性,准确率也有所提高。
  • CNN架构 :使用LeNet - 5架构,它由两组卷积和平均池化层、一个扁平化卷积层、两个全连接层和一个softmax层组成。卷积层分别有20和50个特征图,全连接层有500个输出单元。实验结果显示,使用L1正则化有助于网络减少在训练集上的过拟合,但可能会影响测试性能。总体而言,使用MOP技术在学习过程中可以帮助实现更好的泛化。

4.4 结果对比

架构 有无L1正则化 准确率变化趋势 稀疏性影响
MLP 随着$\varepsilon$变化有提升
MLP 随着L1增加准确率下降,但仍有改进 降低模型复杂度
ResNet 随着$\varepsilon$变化有提升
ResNet 随着L1增加准确率下降,但仍有改进 降低模型复杂度
CNN 随着$\varepsilon$变化有提升
CNN 有助于减少过拟合,但可能影响测试性能 降低模型复杂度

5. 结论

在现代世界中,决策过程越来越依赖于准确的预测。将ML与多准则决策方法相结合的新策略,将更新后的ML模型的每个准则概念化为抽象环境中的向量值优化问题,并建立了稳定性结果,展示了该算法在存在干扰时的工作方式。

学习多个分散的数据集具有更好的泛化能力、降低过拟合敏感性和提高弹性等优点。在多数据集的情况下,展示了如何应用所提出的多准则策略,训练可以在每个数据集上分开并同时进行。通过标量化方法,将该框架应用于多个架构。数值模拟表明,多准则技术为ML与多数据集的结合提供了一个框架,并且通过适当的加权可以提供更高的准确率。

6. 多准则优化在深度学习中的应用优势

6.1 提升模型性能

多准则优化通过同时考虑多个目标,如数据拟合、熵和稀疏性,能够在训练过程中更全面地评估模型。从实验结果来看,无论是MLP、ResNet还是CNN架构,在引入多准则优化后,模型的准确率都有一定程度的提升。例如,在MLP架构中,通过调整扰动参数$\varepsilon$和L1正则化,模型在MNIST数据集上的性能得到了优化。

6.2 增强泛化能力

学习多个分布式数据集可以提高模型的泛化能力。不同的数据集中包含了不同的信息和模式,通过多准则优化平衡各个数据集的信息,可以使模型更好地适应各种情况,减少对特定数据集的依赖,从而在面对新数据时表现更稳定。

6.3 降低过拟合风险

多准则优化中的稀疏性准则可以帮助模型减少不必要的参数,降低模型的复杂度。在实验中,通过L1正则化引入稀疏性,虽然在一定程度上会降低准确率,但可以有效减少模型在训练集上的过拟合,使模型在测试集上的表现更加可靠。

6.4 适应复杂场景

在实际应用中,往往需要考虑多个相互竞争的目标和约束条件。多准则优化可以处理这些复杂的情况,为决策者提供更全面的解决方案。例如,在分布式系统中,决策者需要处理多个节点的目标和潜在的恶意威胁,多准则优化可以帮助平衡这些因素,做出更合适的决策。

7. 多准则优化的实施步骤

7.1 问题定义

  • 明确优化的目标和准则,如数据拟合、熵和稀疏性。
  • 确定输入数据和标签,以及数据的分布情况。
  • 定义度量空间和参数集,为后续的模型构建提供基础。

7.2 模型构建

  • 根据问题定义,构建合适的深度学习架构,如MLP、CNN或ResNet。
  • 设计黑盒函数$f$,用于描述输入数据和输出结果之间的关系。
  • 建立数据拟合/最小化问题,将优化目标转化为数学表达式。

7.3 标量化处理

  • 使用权重对向量值的优化问题进行标量化,将其转化为标量优化问题。
  • 根据具体情况选择合适的权重,以平衡各个准则的重要性。

7.4 稀疏性处理

  • 引入稀疏性准则,如$\ell_1$范数或近似函数,以降低模型的复杂度。
  • 根据实验结果调整稀疏性的程度,找到准确率和模型复杂度之间的平衡点。

7.5 训练和评估

  • 使用训练数据对模型进行训练,通过迭代优化参数,使模型的性能达到最优。
  • 使用测试数据对训练好的模型进行评估,检查模型的泛化能力和准确率。
  • 根据评估结果调整模型的参数和架构,进一步优化模型性能。

7.6 多数据集处理

  • 如果有多个数据集,将训练过程分散到各个数据集上进行,同时平衡各个数据集的信息。
  • 使用线性标量化方法将多个数据集的优化问题合并为一个整体的优化问题。

以下是多准则优化实施步骤的流程图:

graph TD
    A[问题定义] --> B[模型构建]
    B --> C[标量化处理]
    C --> D[稀疏性处理]
    D --> E[训练和评估]
    E --> F{是否满足要求}
    F -- 是 --> G[结束]
    F -- 否 --> B
    B --> H[多数据集处理]
    H --> C

8. 多准则优化的未来发展方向

8.1 算法改进

目前的多准则优化算法在处理大规模数据和复杂问题时可能存在效率问题。未来可以研究更高效的算法,如并行计算、分布式优化等,以提高多准则优化的计算速度和性能。

8.2 融合更多准则

除了数据拟合、熵和稀疏性,还可以考虑引入更多的准则,如模型的可解释性、鲁棒性等。通过融合更多的准则,可以使模型更加全面地满足实际应用的需求。

8.3 跨领域应用

多准则优化在深度学习中的应用不仅局限于图像识别领域,还可以拓展到其他领域,如医疗诊断、金融预测、交通规划等。未来可以探索多准则优化在不同领域的应用,为这些领域带来更有效的解决方案。

8.4 与其他技术结合

可以将多准则优化与其他技术,如强化学习、迁移学习等相结合,进一步提升模型的性能和适应性。例如,通过强化学习动态调整多准则优化的权重,使模型能够更好地适应不同的环境和任务。

9. 总结

多准则优化在深度学习中具有重要的应用价值。通过同时考虑多个目标和约束条件,多准则优化可以提升模型的性能、增强泛化能力、降低过拟合风险,并适应复杂的实际场景。在实施多准则优化时,需要按照问题定义、模型构建、标量化处理、稀疏性处理、训练和评估以及多数据集处理等步骤进行。未来,多准则优化在算法改进、融合更多准则、跨领域应用和与其他技术结合等方面具有广阔的发展前景。

以下是不同深度学习架构在多准则优化下的性能总结表格:
| 架构 | 主要优势 | 多准则优化效果 | 适用场景 |
| — | — | — | — |
| MLP | 结构简单,易于实现 | 提高准确率,降低过拟合 | 简单的分类和回归问题 |
| ResNet | 解决梯度消失问题,可训练更深网络 | 提升模型性能,增强泛化能力 | 深度神经网络训练 |
| CNN | 适合处理图像数据,减少参数数量 | 减少过拟合,实现更好泛化 | 图像和视频处理 |

通过对多准则优化在深度学习中的研究和应用,我们可以更好地应对现代决策过程中对准确预测的需求,为各个领域的发展提供更有力的支持。

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐