论文

面向多模态情绪识别的理据引导学习

Rationale-Guided Learning for Multimodal Emotion Recognition

摘要

对话中的多模态情绪识别(MERC)需要理解言语与非言语线索之间的复杂交互。然而,大多数现有方法从根本上将其视为直接的输入-输出(多模态线索-情绪标签)映射问题,忽视了人类在解读情绪时使用的因果推理。我们提出理据引导学习(RGL),一个将MERC转化为认知启发推理任务的新框架。基于双过程理论,我们将情绪推理分解为三个层面:直觉(即时感知,系统1)、情境(情景分析,系统2)和综合(两者的融合)。我们利用MLLM离线生成结构化理据,将其编码为记忆,通过将内部表示与类人推理模式对齐来指导模型训练。我们的最终模型在推理时运行,无任何MLLM开销。实验结果表明,RGL在IEMOCAP和MELD基准上取得最先进性能。此外,在解释性方面,我们证明模型的内部特征能为未见测试样本有效检索语义正确的理据,验证了其理据推理能力。

面向多模态情绪识别的理据引导学习:论文配图
图1:RGL架构两个主要阶段的概览。(上) 一个MLLM生成结构化理据(Intuitive、Contextual、Integrative),离线构建理据库。(下) 一个紧凑模型通过对比损失训练,使其内部表征与理据库中的理据向量对齐,从而培养类人的推理过程。