论文

E$^3$mo-Bench:通过贝叶斯配对对齐进行多模式诱发和表达情感理解的可扩展基准

E$^3$mo-Bench: A Scalable Benchmark for Multimodal Evoked and Expressed Emotion Understanding via Bayesian Pairwise Alignment

模型评测基准与评测资源

摘要

了解表达的和诱发的情绪对于多模式 大语言模型 (MLLM) 实现全面的情感感知交互至关重要。然而,现有的基准通常孤立地检查表达和诱发的情绪,或者仅限于粗粒度和不完整的情感特征。为了弥补这一差距,我们引入了 E$^3$mo-Bench,这是一个可扩展的基准测试,由 $2{,}524$ 视频中的 $12{,}314$ 问题答案对组成,具有预定义的情感视角。它通过 3 美元的补充任务来评估诱发和表达的情绪理解:情绪感知、开放词汇识别和效价唤醒优势 (VAD) 评估。为了有效地扩展可靠的连续注释,我们提出了贝叶斯成对对齐,它将稀疏、低负担的成对判断聚合到锚引用的 VAD 估计中。此外,我们开发了 E$^3$mo-Score,这是一个 无需训练 代理,它汇总了五模型委员会的补充判断,以改进 VAD 估计。大量的实验验证了我们框架的有效性,并揭示了诱发和表达的情感范式之间明显的性能偏差。这些发现,加上 MLLM 在细粒度识别和维度评估方面持续存在的缺陷,为提高多模态情商制定了明确的路线。