论文
面向多模态情感推理的全感知策略优化
Omni-Perception Policy Optimization for Multimodal Emotion Reasoning
摘要
我们发现当前情感导向的全模态MLLM仍缺乏可靠的全模态感知:它们 (i) 在推理轨迹中未充分利用多模态线索——(ii) 展现不忠实行为——常从其他模态幻觉出模态特定陈述。基于这些洞见——我们提出OPPO(全感知策略优化)——显式优化多模态感知的强化学习框架。第一——全感知奖励把真值推理分解为细粒度视觉、声学与情感线索——并奖励在语义上恢复这些线索的轨迹。第二——全感知损失比较完整输入与单模态遮蔽输入下的策略——仅对模态特定证据token施加KL惩罚以抑制跨模态幻觉。我们进一步介绍MEP-Bench——量化利用率与忠实度的诊断基准。实验表明OPPO在MER-UniBench与MME-Emotion上取得SOTA性能——同时在MEP-Bench上大幅改善利用率与忠实度分数——凸显充分且忠实的全模态感知对多模态情感推理的重要性。
