论文

MVFA:用于情感分析和情绪识别的多视图文本引导多模态融合 LLM 适配器

MVFA: A Multi-View Text-Guided Multimodal Fusion LLM Adapter for Sentiment Analysis and Emotion Recognition

模型训练参数高效训练

摘要

对话中的多模态情感分析和情感识别需要对跨文本、听觉和视觉模态的异构交互进行有效建模。尽管大型语言模型(LLM)提供了强大的语言理解能力,但使其适应多模态情感计算仍然具有挑战性:全模型微调在计算上是令人望而却步的,而许多现有的轻量级适配器无法在跨模态融合过程中保留丰富的文本线索。为了解决这些限制,我们提出了多视图文本引导多模态融合适配器(MVFA),这是一种参数高效的框架,可以通过强大的多模态推理能力增强冻结的大语言模型。 MVFA首先通过最大池化、均值池化和注意力池化构建互补文本视图;然后,这些视图指导与音频和视觉功能的跨模式交互。随后,通过增强型 Q-Former 融合模块将融合的多模态表示压缩为一组紧凑的可学习伪标记。使用 ChatGLM3-6B-base 作为主要主干,我们进一步在 LLaMA2-7B 和 Qwen3-8B 上验证 MVFA,以检查其在多个冻结的 LLM 主干上的可移植性。 MVFA 在三个具有挑战性的数据集上进行评估:CH-SIMS V2.0、MELD 和 CHERMA。实验结果表明,MVFA 在关键指标上实现了最先进的性能,同时仅更新了一小部分参数。具体来说,它在 CH-SIMS V2.0 上达到 84.62\% Acc2 和 84.59\% F1,在 MELD 上达到 67.36\% Acc 和 66.03\% WF1,在 CHERMA 上达到 74.66\% Acc。这些发现将多视图文本引导融合确立为情感计算中参数高效多模态 LLM 适应的有效且可扩展的范例。该代码可通过此 https URL 公开获取。

MVFA:用于情感分析和情绪识别的多视图文本引导多模态融合 LLM 适配器:论文配图
图 2:拟议的 MVFA 框架概述。轻量级编码器首先从音频和视觉模态中提取表示。然后,MVFA 通过最大池化、均值池化和注意力池化构建互补文本视图,逐步融合它们以指导跨模态交互,并通过增强型 Q-Former 融合模块 (ENQF) 将生成的多模态表示压缩为一小组伪Token。这些伪标记与原始文本嵌入 TT 和提示增强文本嵌入 TpT_{p} 连接起来,形成输入序列 Xinput=[P;T;Tp]X_{\text{input}}=[P;T;T_{p}],该序列被输入到冻结的 LLM 中以进行自回归情感或情绪预测。只有 MVFA 接受了培训,而 LLM 骨干仍处于冻结状态。