论文
信标:知道何时以及如何执行代理视觉推理
Beacon: Knowing When and How to Perform Agentic Visual Reasoning
摘要
代理视觉推理的根本目标是提高多模态 大语言模型 (MLLM) 在复杂任务上的成功率。我们通过工具使用的两个关键维度重新思考代理视觉推理:模式适应性和工具效果。模式适应性表征 MLLM 是否能够识别何时需要工具并相应地调用它们,从而避免不必要的计算开销,同时提高需要工具辅助的问题的性能。工具效应表征工具是否扩展了模型在通过无工具推理无法解决的问题上的能力,而不会在它已经可以解决的问题上引入错误。我们的分析量化了这些属性,并揭示了现有模型表现出有限的模式适应性,而在困难示例上工具使用的收益在很大程度上被简单示例上的损害所抵消。受这些观察的启发,我们提出了 Beacon,这是一种采用监督 微调 (SFT) 和强化学习 (RL) 训练的新型代理视觉推理模型。其强化学习阶段结合了必要性感知自适应奖励和提示引导的能力扩展。必要性感知自适应奖励在成功时鼓励无工具解决方案,同时在无工具推广失败时保留对成功使用工具的全额奖励。提示引导的能力扩展使用经过验证的、无答案的专家提示来从完全错误的采样轨迹组中恢复学习信号,旨在扩展解决最困难问题的工具使用能力。在 13 个基准测试中,Beacon 在评估的开源模型中取得了最高的平均分,并在 11 个基准测试中排名第一。在五个诊断基准上,它的平均工具可用精度比无工具精度提高了 1.96 分,并实现了最大的工具增益减去工具伤害分数(+3.14 分)。这些结果显示了 Beacon 的先进性能、模式适应性以及工具使用的净收益。