论文

面向多模态情感推理的全感知策略优化

Omni-Perception Policy Optimization for Multimodal Emotion Reasoning

模型训练强化学习

摘要

我们发现当前情感导向的全模态MLLM仍缺乏可靠的全模态感知:它们 (i) 在推理轨迹中未充分利用多模态线索——(ii) 展现不忠实行为——常从其他模态幻觉出模态特定陈述。基于这些洞见——我们提出OPPO(全感知策略优化)——显式优化多模态感知的强化学习框架。第一——全感知奖励把真值推理分解为细粒度视觉、声学与情感线索——并奖励在语义上恢复这些线索的轨迹。第二——全感知损失比较完整输入与单模态遮蔽输入下的策略——仅对模态特定证据token施加KL惩罚以抑制跨模态幻觉。我们进一步介绍MEP-Bench——量化利用率与忠实度的诊断基准。实验表明OPPO在MER-UniBench与MME-Emotion上取得SOTA性能——同时在MEP-Bench上大幅改善利用率与忠实度分数——凸显充分且忠实的全模态感知对多模态情感推理的重要性。

面向多模态情感推理的全感知策略优化:论文配图
图 1:现有的情感 Omni-MLLM 缺乏对视觉和听觉线索的可靠感知。 (a) 未充分利用(违反利用原则)。 MEP-Bench 的一个实证案例,其中 AffectGPT-R1(Lian 等人,2025c)忽略了细粒度​​的视觉线索(例如皱眉、悲伤的眼睛),并且由于“思维惯性”而主要依赖于音频中的哭声。 (b) 不忠实(违反忠实原则)。在一个经验案例中,即使视频被屏蔽,AffectGPT-R1也会基于愤怒的语气和虚假的视听相关性在视频中产生“皱眉”的幻觉。 (c) 左:MEP-Bench 上的多模态召回;基线模型仅捕获大约一半的人工注释线索,而我们的 OPPO 实现了更高的召回率。右:MEP-Bench 上单峰掩蔽探针的准确性;我们的 OPPO 在视频和音频屏蔽问题上都获得了更高的忠实度。