论文

ToolVision:学习何时以及如何使用具有能力协调监督的可视化工具

ToolVision: Learning When and How to Use Visual Tools with Capability-Aligned Supervision

模型训练奖励建模与过程监督

摘要

用图像思考允许多模态模型通过代码调用视觉工具来补偿有限的感知。然而,流行的 SFT-then-RL 配方在每个阶段都会造成不同的监督失调。 SFT 预计将教授如何使用工具,但较强教师的轨迹可能会通过感知能力而取得成功,而较小的学生无法可靠地复制或利用这些能力,从而导致学生模仿工具调用模式而不学习如何使它们有用。强化学习有望教会何时使用工具,但只注重结果的奖励会使错误的工具执行成为一种负担,并抑制工具的使用,而对每个正确的工具使用轨迹的全面奖励会鼓励有效但无效的操作。为了解决这两个错位问题,我们引入了 ToolVision。在 SFT 期间,多智能体管道探索候选轨迹,并且由学生规模模型组成的委员会对逐步证据增益进行评分,以对搜索分支进行排名和修剪。只有成功执行且最终答案正确的轨迹才会保留用于 SFT。在强化学习之前,ToolVision 会比较学习者使用工具和不使用工具时的表现,然后仅在工具能带来明显好处的问题上奖励成功使用工具的人。这两个信号都是根据公共任务数据自动构建的,无需对工具使用或必要性进行额外的人工注释。 ToolVision-8B 在所有七个主要基准测试上均有所改进,在所有三个高分辨率基准测试上均超过 Thyme-7B、CodeVision-8B 和 CodeDance-7B,并在 V* 和 HRBench 8K 上优于 Qwen3-VL-32B-Thinking。我们将公开发布数据集和源代码。