论文

EMO-R3:面向多模态大语言模型情感推理的反思式强化学习

EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models

模型训练强化学习

摘要

多模态大语言模型(MLLM)在视觉推理与理解任务上取得显著进展,但仍难以捕捉人类情绪的复杂性与主观性。基于监督微调的现有方法常常泛化有限、可解释性差,而群组相对策略优化(Group Relative Policy Optimization)等强化学习方法无法与情绪认知的内在特性对齐。为应对这些挑战,我们提出面向情感推理的反思式强化学习(EMO-R3),一个旨在增强MLLM情感推理能力的框架。具体而言,我们引入结构化情绪思考(Structured Emotional Thinking),引导模型以结构化、可解释的方式逐步进行情绪推理;并设计反思式情绪奖励(Reflective Emotional Reward),使模型能够基于视觉-文本一致性与情绪连贯性重新评估自身推理。大量实验表明,EMO-R3显著提升MLLM的可解释性与情绪智能,在多个视觉情绪理解基准上取得优越表现。

EMO-R3:面向多模态大语言模型情感推理的反思式强化学习
图2: EMO-R3 架构示意图。上半部分展示结构化情感思考(Structured Emotional Thinking)提示,它由三个连续的思考步骤及随后的最终答案组成。下半部分展示反思性情感奖励(Reflective Emotional Reward)机制,其中多个 rollout 样本基于图文一致性与情感连贯性进行评估,并在 GRPO 框架下与原有的 Format 与 Accuracy 奖励共同优化。