论文
EmoMM:冲突和缺失下多模态情绪识别的基准测试和指导 MLLM
EmoMM: Benchmarking and Steering MLLM for Multimodal Emotion Recognition under Conflict and Missingness
摘要
多模态情绪识别 (MER) 对于解释现实世界的交互至关重要。虽然多式联运 大语言模型 (MLLM) 在 MER 中展现出了希望,但其在模态冲突和缺失情况下的内部决策机制在很大程度上仍未得到充分探索。在本文中,为了系统地研究这些行为,我们引入了 EmoMM,这是一个具有模态对齐、冲突和缺失子集特征的综合基准。通过广泛的评估,我们发现了视频贡献崩溃(VCC)现象,其中 MLLM 由于高词元冗余和模态偏好而边缘化视频证据。为了解决这个问题,我们提出了冲突感知头级注意力转向(CHASE),这是一种轻量级机制,可以检测模态冲突并执行推理时注意力转向,从而有效地减轻决策偏差,而无需重新训练骨干网。实验结果表明,CHASE 在各种设置下持续提高性能,显着增强 MLLM 在复杂情感场景中的可靠性。