论文
AffectVerse:多模态情感计算的情感世界模型
AffectVerse: Emotional World Models for Multimodal Affective Computing
摘要
人类通过将观察到的多模态线索与对情感状态如何展开的预期相结合来推断情绪。然而,现有的多模态 大语言模型 (MLLM) 通常将情感识别视为完整视听文本输入的静态融合,从而隐含情感动态。我们提出了 AffectVerse,一个基于 Qwen2.5-Omni 的模型,配备了情感世界模块(EWM),这是一个用于短视野潜在情感预测的无动作表示级模块。 \rev{EWM 包含三个模块:1) 跨模态时间想象通过多步部署从过去的标记预测未来的视频/音频表示。 2)MAMA(Modality-Aware Multi-step Attention)信念聚合将想象的标记压缩为模态感知的信念标记。 3) 信念注入将这些信念标记插入到 LLM 中进行情感推理。}AffectVerse 使用未来预测作为过去条件的自我监督信号:它不会取代对观察到的历史进行建模或在推理时需要看不见的信号,而是强制当前的信念状态对可预测后续情感变化的转换线索进行编码。在九个基准测试中,AffectVerse 比其他模型至少提高了 2.57%,而受控消融显示出来自时间想象、跨模式采样轨迹和信念聚合的额外收益。这些结果表明预测信念状态建模是情感计算的实用替代方案。