应用情感计算的机器学习方法:从单模态到多模态特征融合

1. 单模态特征提取

1.1 视觉模态

视觉特征提取可分为手工特征和基于深度学习的特征提取。
- 手工特征 :有研究提出使用一组 3D 身体姿态特征,如动能、收缩指数和密度、平滑度、流畅性、对称性、上半身前后倾斜和相对位置、直接性、周期性和冲动性,来识别自闭症儿童的情绪。还有研究使用一组姿势、运动学和几何描述符与多类支持向量机,从 3D 骨骼运动中识别情绪。
- 基于深度学习的特征提取
- 预训练卷积神经网络(CNNs) :如 AlexNet 和 Oxford VGGNet,基于领域迁移学习,将在大型计算机视觉任务数据集上预训练的 CNNs 迁移到情感计算任务的视觉特征提取中。
- 3D 卷积神经网络(3D - CNNs) :用于学习时空特征,其架构由八个卷积层、五个池化层、两个全连接层和一个 softmax 输出层组成,基于 3D - CNNs 的特征在分类任务中比传统 2D - CNNs 的特征更具判别性。
- 卷积循环神经网络(CRNNs) :由 CNNs 和循环神经网络(RNN)堆叠训练而成,用于从视觉模态进行情绪识别。

1.2 音频模态

音频信号在情感识别中被广泛研究,人类日常交流中的语音携带了情感信息。
- 声学和韵律特征 :音高、强度、语速和语音质量等被提取用于分析人类语音表达和情感状态的模式。研究还通过寻找声门压力、跨声门气流和声带振动的模式来研究语音中的情感线索,常用的声学特征包括语速(时域)、基频和共振峰频率(频域)、能量和响度(信号幅度)以及不同频段的相对能量(频谱分布)。
- 情感维度相关特征
- 声学唤醒 :基频和响度是区分语音唤醒的重要韵律特征。
- 语音效价 :波形的频谱形状和基于语速的特征是语音效价的重要特征。Mel - 频率倒谱系数(MFCCs)因其能很好地描述音频信号的频谱形状而受到关注。
- 特征提取层次 :音频特征可在局部和全局层次提取。局部层次是将音频信号分割成重叠或非重叠的片段进行处理;全局层次是对局部特征进行统计分析,如计算局部特征在各片段上的均值和标准差,这会减少特征空间,但会忽略时间信息。

1.3 生理模态

人类的情感状态也编码在生理信号中,生理信号具有可重复、客观反映情感状态,且可通过便携式设备收集的优点。
- 常见生理信号
1. 脑电图(EEG) :测量大脑活动。
2. 心电图(ECG) :测量心脏活动。
3. 皮肤电活动(EDA) :测量皮肤汗腺的电导率。
4. 肌电图(EMG) :测量肌肉活动。
5. 眼电图(EOG) :测量眼球运动。
- 处理步骤 :大多数基于生理信号的情感感知系统包含三个顺序处理步骤:
1. 生理信号预处理 :去除噪声和肌肉运动伪影,可使用低通滤波器(如椭圆和巴特沃斯滤波器),还可考虑重采样和归一化。
2. 特征提取和/或选择 :可从统计特征(如均值、中位数、标准差、最小值和最大值)、基于傅里叶变换的特征到基于小波变换的特征等多种方法中选择合适的特征提取方法。当小样本生理数据的高维表示影响系统性能时,可应用特征选择方法,如顺序前向选择或顺序后向选择。
3. 分类或回归 :对提取的特征进行分类或回归分析。

1.4 语言模态

语音内容在交流中很重要,除了语音线索外还携带情感信息。
- 情感信息编码 :部分情感信息可从情感词词典中的单个单词编码,其余情感信息需考虑语义上下文才能揭示。
- 情感识别方法
- 词汇分析 :如基于语言查询和词频统计(LIWC)的情感识别方法,通过基于词典的分类来揭示描述情感内容的单词。
- 语料库方法 :假设人们对不同情绪有相似的概念,形成情感术语词库,如英语词汇数据库 WordNet,可使用英语单词的规范情感评级来检测语音的情感内容。先进的情感检测系统更注重识别整个语音内容的情感基调。

2. 基于深度学习的单模态特征提取

2.1 音频特征提取

  • CNN 与自编码器 :常用于从原始音频信号中学习特征,但无法建模时间信息和上下文。
  • 长短期记忆循环神经网络(LSTM - RNNs)或双向长短期记忆循环神经网络(BLSTM - RNNs) :在手工声学特征上运行,能够在学习声学特征表示时考虑时间信息。此外,基于 CNN 的特征可按顺序用于训练情感识别机器学习模型。

2.2 生理特征提取

多种深度学习技术,如深度信念网络(DBNs)、堆叠自编码器和 CNNs,被用于挖掘生理信号中编码的人类情感状态的隐藏模式,学习不同生理信号的抽象中间表示。但由于训练实例有限和模型过拟合的风险,深度学习技术在生理信号分析中的应用受到一定限制。
- EMG 信号分析 :DBNs 可用于可视化解释面部 EMG 信号在语音产生中的复杂模式。
- EEG 信号分析 :LSTM - RNNs 可用于检测观看视频时的情绪状态,建模情绪得分和 EEG 测量之间的时间依赖关系。
- ECG 信号分析 :有研究提出端到端学习框架,利用 CNNs 和 RNNs 学习 ECG 测量的中间表示用于情感识别。
- EOG 信号分析 :CNNs 和 DBNs 可用于学习 EOG 测量的判别表示。
- EDA 信号分析 :CNNs 和 DBNs 成功取代了手工特征和特征选择,作为 EDA 测量的端到端学习方法。

2.3 语言特征提取

深度学习技术在自然语言处理(NLP)中取得了显著进展,能够在不同 NLP 任务中超越大多数先进方法。
- 递归自关联记忆 :可用于建模句子组成。
- 预训练词嵌入 :将句子或文档中的词向量连接起来作为深度学习模型的输入数据,优于基于意见挖掘的现有特征工程方法。
- BERT 模型 :一种新的语言表示模型,可在未标记数据上进行训练,通过联合考虑文本的左右上下文。预训练的 BERT 模型添加额外输出层后,可轻松微调以构建适用于广泛 NLP 任务的模型,如问答和语言推理。

3. 多模态情感感知系统

3.1 多模态融合的重要性

多模态融合是将从不同模态收集的数据进行组合的过程,使用互补模态可以提高情感感知系统的性能。由于不同模态的数据收集形式和时间间隔不同,可能需要在不同层次进行多模态融合。

3.2 多模态融合的类型

  • 特征级融合(早期融合) :将每个模态的特征组合成一个单一的特征向量,用于进行统计分析或训练机器学习模型。优点是可以发现各种多模态特征之间的非线性依赖关系,从而提高系统性能;缺点是需要对多模态特征进行时间同步,且要求特征格式相同,因为多模态特征在时域的采样和表示方式往往不同。
  • 决策级融合(晚期融合) :独立检查每个模态在给定情感识别任务中的表现,然后在决策级别将各模态的结果组合起来做出最终决策,如多数投票。优点是多个模态的决策易于合并和比较,且可针对每个模态选择最合适的统计分析和机器学习方法;缺点是当只考虑两个对给定任务信息相似的模态时,最终决策可能不稳定。
  • 层次(混合)融合 :结合了特征级和决策级融合的方法,试图同时利用两者的优点并克服其缺点。例如,使用长短期记忆网络(LSTMs)对音频 - 视频电影特征与观众的生理和行为反应进行层次融合,用于电影观众的情绪识别。
  • 模型级融合 :测量不同模态特征之间的依赖关系。例如,提出隐马尔可夫模型(HMM)的扩展用于音频 - 视觉情感识别,通过测量最大熵和互信息来寻找多个流之间的联系。还有各种神经网络架构被用于合并音频和视觉信号进行情绪识别,如贝叶斯网络拓扑可通过概率合并音频和视觉模态来预测情绪。

3.3 融合方法分类

根据研究问题的特点,融合方法可分为三类:
- 规则基融合 :使用统计规则合并多模态特征,如线性加权融合和多数投票。线性加权融合通过求和运算符组合不同模态的信息或分类器的决策,多数投票则依赖于多数的决策。
- 分类或回归基融合 :基于分类或回归算法进行融合。
- 估计基融合 :通过估计方法进行融合。

以下是多模态融合类型的对比表格:
| 融合类型 | 优点 | 缺点 |
| ---- | ---- | ---- |
| 特征级融合 | 发现多模态特征非线性依赖,提高系统性能 | 需要特征时间同步和相同格式 |
| 决策级融合 | 决策易合并比较,可针对模态选方法 | 考虑两相似模态时决策不稳定 |
| 层次(混合)融合 | 结合特征级和决策级优点 | |
| 模型级融合 | 测量模态特征依赖关系 | |

下面是多模态情感感知系统中数据处理和融合的 mermaid 流程图:

graph LR
    classDef process fill:#E5F6FF,stroke:#73A6FF,stroke-width:2px

    A[视觉模态数据]:::process --> B(特征提取):::process
    C[音频模态数据]:::process --> B
    D[生理模态数据]:::process --> B
    E[语言模态数据]:::process --> B
    B --> F{融合方式选择}:::process
    F --> G1(特征级融合):::process
    F --> G2(决策级融合):::process
    F --> G3(层次融合):::process
    F --> G4(模型级融合):::process
    G1 --> H(训练模型/分析):::process
    G2 --> H
    G3 --> H
    G4 --> H
    H --> I(情感识别结果):::process

综上所述,在情感计算中,单模态特征提取为情感识别提供了基础,而多模态融合则通过整合不同模态的信息,进一步提高了情感感知系统的性能。不同的特征提取和融合方法各有优缺点,在实际应用中需要根据具体任务和数据特点进行选择和优化。

4. 单模态特征提取总结

4.1 各模态特征提取优势

不同的单模态特征提取在情感计算中发挥着独特的作用,以下是各模态的优势总结:
| 模态 | 优势 |
| ---- | ---- |
| 视觉模态 | 可直观捕捉表情、姿态等信息,深度学习方法能学习复杂时空特征 |
| 音频模态 | 语音携带丰富情感线索,声学和韵律特征可有效区分情感状态 |
| 生理模态 | 客观反映情感状态,不受主观掩饰影响,且可通过便携设备收集 |
| 语言模态 | 内容直接表达情感,结合语义分析能挖掘深层次情感信息 |

4.2 面临的挑战

尽管各模态有其优势,但也面临一些共同的挑战:
- 数据质量问题 :如视觉模态中的光照变化、音频模态的背景噪音、生理模态的信号干扰等,都会影响特征提取的准确性。
- 特征选择与降维 :高维特征可能导致计算复杂度增加和过拟合问题,需要有效的特征选择和降维方法。
- 跨个体差异 :不同个体在相同情感下的表现可能存在差异,增加了情感识别的难度。

5. 深度学习在单模态特征提取中的应用分析

5.1 深度学习的优势

深度学习在单模态特征提取中展现出显著的优势:
- 自动特征学习 :能够从原始数据中自动学习到抽象的特征表示,减少了手工特征工程的工作量。
- 捕捉复杂模式 :可以捕捉到数据中的复杂模式和隐藏信息,提高情感识别的性能。
- 端到端学习 :实现从原始数据到情感标签的端到端学习,简化了模型结构。

5.2 局限性及应对策略

深度学习也存在一些局限性,如训练数据要求高、模型可解释性差等。针对这些问题,可以采取以下策略:
- 数据增强 :通过数据增强技术扩充训练数据,缓解训练实例有限的问题。
- 模型融合 :结合多种深度学习模型或传统机器学习方法,提高模型的稳定性和泛化能力。
- 可解释性研究 :开展深度学习模型可解释性的研究,帮助理解模型的决策过程。

以下是深度学习在各单模态特征提取中的应用情况对比表格:
| 模态 | 常用深度学习方法 | 优势 | 局限性 |
| ---- | ---- | ---- | ---- |
| 音频 | CNN 与自编码器、LSTM - RNNs 等 | 学习音频特征,考虑时间信息 | 无法建模时间信息和上下文(部分方法) |
| 生理 | DBNs、CNNs 等 | 挖掘隐藏模式,学习抽象表示 | 训练实例有限,易过拟合 |
| 语言 | 递归自关联记忆、BERT 等 | 超越传统 NLP 方法,处理语义信息 | |

6. 多模态融合的优化与展望

6.1 融合方法的优化策略

为了进一步提高多模态情感感知系统的性能,可以采取以下优化策略:
- 特征选择与融合顺序 :在特征级融合中,选择最具代表性的特征进行融合,并优化融合顺序,以减少冗余信息。
- 决策融合规则优化 :在决策级融合中,设计更合理的决策融合规则,如加权投票、基于置信度的融合等。
- 混合融合策略设计 :层次(混合)融合中,根据不同模态的特点和任务需求,设计更有效的混合融合策略。

6.2 未来发展方向

多模态情感感知系统在未来有广阔的发展前景,以下是一些可能的发展方向:
- 多模态数据的实时处理 :实现多模态数据的实时采集、处理和融合,以满足实时情感识别的需求。
- 跨领域应用拓展 :将多模态情感感知技术应用于更多领域,如医疗保健、教育、智能交通等。
- 情感理解与交互 :不仅识别情感,还能理解情感背后的原因,并实现更自然的情感交互。

下面是多模态融合优化策略的 mermaid 流程图:

graph LR
    classDef process fill:#E5F6FF,stroke:#73A6FF,stroke-width:2px

    A[特征级融合]:::process --> B(特征选择):::process
    B --> C(优化融合顺序):::process
    D[决策级融合]:::process --> E(优化决策规则):::process
    F[层次(混合)融合]:::process --> G(设计混合策略):::process
    C --> H[优化后的多模态融合]:::process
    E --> H
    G --> H

总之,情感计算中的单模态特征提取和多模态融合技术在不断发展和完善。通过深入研究各模态的特征提取方法、充分发挥深度学习的优势以及优化多模态融合策略,有望实现更准确、更智能的情感识别和理解,为各个领域的应用带来新的突破。

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐