论文

AdaReasoner:面向迭代视觉推理的动态工具编排

AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning

模型训练强化学习RLVRAgentic RL

摘要

当人类面对超出自身即时能力的问题时,会借助工具,这为提升多模态大语言模型(MLLM)的视觉推理提供了有前景的范式。因此,有效的推理取决于知道使用哪些工具、何时调用它们以及如何在多步骤中组合它们,即使面对新工具或新任务也是如此。我们提出AdaReasoner,一系列将工具使用作为通用推理技能而非工具特定或显式监督行为来学习的多模态模型。AdaReasoner由以下要素支撑:(i)可扩展的数据整理流水线,使模型接触长程、多步的工具交互;(ii)Tool-GRPO,一种基于端到端任务成功来优化工具选择与排序的强化学习算法;(iii)动态调节工具使用的自适应学习机制。这些组件共同使模型能从任务上下文和中间结果推断工具效用,实现多工具协调并向未见工具泛化。实验上,AdaReasoner展现出强的工具自适应与泛化行为:它自主采纳有益工具、抑制无关工具,并根据任务需求调整工具使用频率,尽管从未被显式训练这样做。这些能力转化为在挑战性基准上的最先进性能,将7B基座模型平均提升24.9%,并在包括VSP和Jigsaw在内的多项任务上超越GPT-5等强大专有系统。

AdaReasoner:面向迭代视觉推理的动态工具编排
图2:我们的 AdaReasoner 框架概览。该流水线包含两个主要阶段:(a) Tool Cold Start(TC)阶段,其中精心构建轨迹以支持多轮推理;以及 (b) Tool GRPO(TG)阶段,其中通过由我们自适应的多轮奖励引导的强化学习进一步优化策略。此外,Adaptive Learning 方法(c)可应用于 TC 与 TG 两个阶段,从而提升跨任务与跨工具配置的泛化能力。