论文
言出必行:通过多模式代理策略优化弥合图像思维的推理与行动差距
Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization
摘要
多模态 大语言模型 (MLLM) 的最新进展通过在多轮推理过程中主动调用视觉工具来激励模型“用图像思考”。依赖基于结果的奖励的常见强化学习(RL)实践忽略了文本合理性常常掩盖执行失败的事实,这意味着模型可能会表现出直观的文本推理,同时在其代理推理轨迹内执行不精确或不相关的视觉动作。这种推理-动作差异引入了在多轮推理过程中累积的噪声,严重降低了模型的多模态推理能力,并可能导致训练崩溃。在本文中,我们引入了多模态代理策略优化(MAPO),弥合了文本推理和多模态思想链(MCoT)内模型生成的视觉动作之间的差距。具体来说,MAPO 要求模型为通过工具使用获得的视觉内容生成明确的文本描述。然后,我们采用一种新颖的优势估计,将这些描述和实际观察之间的语义对齐与任务奖励结合起来。理论研究结果证明了 MAPO 背后的基本原理,它本质上减少了梯度的方差,并且大量的实验表明我们的方法在多个视觉推理基准上实现了卓越的性能。