论文

EmoAgent-R1:经强化学习动态智能体专属化迈向多模态情绪理解

EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization

模型训练强化学习RLVRAgentic RL

摘要

多模态大语言模型(MLLM)在多模态情绪识别(MER)任务上取得出色表现,把MER提升到复杂情绪理解的新层级——具备高级视频理解能力与自然语言描述。但既有基于MLLM的方法常用固定提示感知情绪,忽视多模态输入中情绪源的动态性与复杂性。为解决这些问题,我们提出基于强化学习的动态智能体专属化框架EmoAgent-R1:以动态智能体专属化优化MLLM的情绪识别、推理与泛化能力。具体地,先采用冷启动策略——以合成的答案条件思维链数据与智能体路由数据训练——赋予MLLM初步的情绪识别、推理与智能体路由能力;随后以强化学习进一步训练MLLM,在含智能体选择与智能体专属化的两步智能体工作流中感知情绪。为有效训练EmoAgent-R1,我们提出新颖的渐进群相对策略优化(P-GRPO):把基于群的相对优势与受PMI启发的渐进token级调制结合,把稀疏奖励转为细粒度学习信号,缓解GRPO中粗粒度均匀信用分配的问题。在MER基准上的大量实验证明EmoAgent-R1在更强的情绪推理表现与改善的优化稳定性上的优越性。

EmoAgent-R1:经强化学习动态智能体专属化迈向多模态情绪理解:论文配图
图 1. 传统整体代理(上半部分)和建议的 EmoAgent-R1 框架(下半部分)之间的比较。整体代理使用单个静态提示来统一分析所有模式。相比之下,EmoAgent-R1采用两阶段代理工作流程:路由器代理首先根据输入的特征选择最合适的专用代理,然后所选的专用代理执行集中推理以得出最终的情感。这种动态专业化可以实现更具适应性和更准确的多模态情感理解。