论文

MER-R1:经慢快思考协同的多模态情感推理

MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy

模型训练强化学习

摘要

我们发现显式推理未必转化为更好的多模态情感识别(MER)准确率——尽管它使预测更可解释。具体地——对基于推理的MLLM——触发直接回答的快思考常在深思推理后胜过慢思考。实证分析显示快思考以更广更自信的预测改进召回——慢思考经对错误类别的保守过滤偏好精确。基于这些洞见——我们提出MER-R1——把慢快互补性转为显式优化的强化学习框架。双目标解缠把召回与精确分成两个优化信号——使其可联合优化而非相互权衡。慢快置信度校准进一步把最终慢思考答案与快思考直觉对齐——强化正确情感、抑制错误情感。由此——MER-R1统一快思考的召回导向直觉与慢思考的精确导向选择性。我们进一步为该协同提供理论论证——表明其缓解优化中方差诱导的干扰。MER-UniBench与MME-Emotion上的大量实验表明MER-R1取得SOTA性能——使推理真正惠及情感识别。

MER-R1:经慢快思考协同的多模态情感推理:论文配图
图 1:MER 中的思维悖论和慢-快协同作用。 (a) 激励示例:缓慢思考是谨慎的,但可能会错过有效的情绪,而快速思考可以提高覆盖范围,但会引入噪音。慢速协同结合了它们的优势互补。 (b) 9个数据集的评估总结:与直觉相反,快速思维优于慢速思维。