论文
SemMSA:不完整数据的潜在语义辅助鲁棒多模态情感分析
SemMSA: Latent Semantic-Aided Robust Multimodal Sentiment Analysis with Incomplete Data
摘要
多模态情感分析 (MSA) 的最新研究重点是从语言、视觉和听觉模态中学习不完整的数据来推断人类情感。大多数研究通常通过重建模态特征或设计复杂的融合机制来补偿丢失的信息。然而,由于部分观察到的多模态证据缺乏高级语义基础,这些方法仍然受到虚假生成和噪声指导的影响。为了解决这些问题,我们提出了 SemMSA,一种潜在的语义辅助框架,它使用 LLM 构建丰富的情感相关语义,通过无锚谱对齐与所有模态完全集成。它主要由跨模态语义细化(CSR)和跨模态谱对齐(CSA)组成。具体来说,CSR 首先通过相应的适配器自适应地提取视觉和听觉表示,以在冻结的 LLM 嵌入空间中与语言形成统一的多模态前缀。然后,它通过词元有效的潜在细化过程迭代地产生连续的判别语义状态,而无需解码显式文本。接下来,CSA 通过增强其内核 Gram 矩阵的主要频谱分量,同时将精炼语义与所有模态对齐。这捕获了所有表示之间的全局非线性依赖性,而不依赖于预定义的锚模态。此外,实例级光谱分离约束保留了跨样本可辨别性并减轻了表示崩溃。 SIMS、MOSI 和 MOSEI 基准的大量实验表明 SemMSA 实现了最先进的性能。