论文

多模态代理推理的代理探索策略优化

Agent Explorative Policy Optimization for Multimodal Agentic Reasoning

模型训练强化学习

摘要

具有扩展推理功能的视觉语言模型可以成功解决复杂问题,但许多现实世界的问题需要外部工具,而仅靠内部推理通常无法解决。因此,主体推理将两种具有结构不对称性的行为交织在一起:思考(独立的默认行为)和工具使用(高方差的辅助行为)。我们将这种不对称称为“思维-行动差距”。在 GRPO 等标准 RL 方案下,这种差距在训练期间表现为两种诊断症状:仅在大约 30% 的首次轨迹采样中尝试使用工具,而在尝试时,组内使用工具的首次轨迹采样在大约 40% 的问题上都是错误的,抑制了需要它的工具调用处的学习信号。我们提出 AXPO(代理探索策略优化):对于每个完全错误的工具使用子组,AXPO 修复思考前缀并对工具调用及其延续进行重新采样,并与基于不确定性的前缀选择配对。在九个多模态基准测试和三个量表的 Qwen3-VL-Thinking 中,SFT+AXPO 平均优于 SFT+GRPO(8B 时平均+1.8pp Pass@1 和 +1.8pp Pass@4),并且 SFT+AXPO 的 8B 超过了 Pass@4 上的 32B Base,参数减少了 4 倍。