论文

多模态情感分析的显式表示对齐

Explicit Representation Alignment for Multimodal Sentiment Analysis

上下文与知识上下文工程

摘要

多模态情感分析旨在通过对文本和图像等异构模态进行联合建模来理解人类的情感和情感。然而,多模态模型通常无法始终优于强大的纯文本基线,不同融合策略的性能差异很大。在这项工作中,我们将独立预训练的模态编码器之间的表示不对齐确定为有效多模态学习的关键瓶颈,并通过受控实验表明,融合之前的对齐通常比融合复杂性更重要。为了解决这个问题,我们提出了一个统一的多模态情感分析框架,该框架利用视觉语言模型(VLM)将视觉内容转换为结构化文本描述,将异构模态投影到共享语言空间中并实现可解释的以文本为中心的推理。为了进一步提高鲁棒性,我们引入了一种混合学习策略,该策略将语义标记选择与批次级均匀性正则化目标相结合,鼓励更加分散和稳定的全局特征空间,同时减轻 VLM 生成的描述引入的噪声。对多个多模态情感和情感基准的实验表明,我们的方法始终优于强大的单模态和多模态基线,实现了最先进的性能。我们的分析进一步强调了表征对齐在多模式情感学习中的关键作用。