论文
VC-Tooler:学习组合和自适应视觉工具的使用
VC-Tooler: Learning Compositional and Adaptive Visual Tool Use
摘要
代理多模态推理允许 VLM 通过视觉工具交互主动获取和完善视觉证据,从而扩展被动图像理解。有效的视觉工具使用需要三种能力:在视觉上下文中扎根工具调用、跨多个步骤组合工具以及根据工具返回的观察结果调整推理。然而,现有的方法主要侧重于固定工具空间和严格的调用模式的基础,而没有充分解决组合和适应问题。我们提出了 VC-Tooler,它学习视觉工具的使用作为组合和自适应能力。为此,我们首先通过涵盖三个功能级别的分层综合管道构建轨迹库:单工具基础、多工具组合以及多样化的工具上下文和接口。然后,我们分两个阶段训练模型:建立这些功能的监督冷启动,然后是鼓励准确、高效和上下文感知的视觉工具使用的强化学习。 VC-Tooler 在通用和代理基准测试上均实现了开源模型中最先进的性能,包括 V* 上的 $95.8\%$ 和 VTC-Bench 上的 $35.3\%$,并且在推理时在更丰富的工具设置下显示出有希望的迁移。项目页面:https://w1zheng.github.io/VC-Tooler