论文
基于 LLM 的多模态情感分析的多粒度情感集成
Multi-Granularity Sentiment Integration for LLM-Based Multimodal Sentiment Analysis
摘要
多模态情感分析 (MSA) 旨在从文本、音频和视觉等异构输入中预测情感极性和强度。虽然 大语言模型 (LLM) 为 MSA 提供了强大的语义先验,但有效地合并音频和视觉信号仍然具有挑战性。一个关键的挑战是音频和视觉情感线索在不同的时间尺度上演变,然而许多基于 LLM 的方法在将这些信号与文本融合之前通过浅投影或粗池化来压缩这些信号,这可能会削弱跨模式对齐并擦除细粒度的情感信息。我们提出 MGSI,一种基于 LLM 的 MSA 的多粒度情感集成框架。 MGSI 首先对短、中、长范围时间尺度的音频和视频流进行编码,保留局部变化和全局情感趋势。然后,它通过文本引导的对齐来细化非文本特征,并应用极性和强度感知增强来更好地处理模糊和接近中性的样本。生成的多模态表示最终被压缩为一小组伪词元,以便有效调节冻结的 LLM。对四个公共基准的实验表明,MGSI 大大优于冻结的 LLM 基线,并且与强大的多模态方法相比仍然具有竞争力。进一步的消融和敏感性分析支持多粒度时间建模、文本引导细化和自适应情绪校准的有效性。