论文
让每次工具调用都发挥作用:智能体视觉语言模型的必要工具证据路径奖励
Making Every Tool Call Count: Necessary Tool-Evidence Path Rewards for Agentic Vision-Language Models
摘要
现代视觉语言模型(VLM)可以直接回答许多基于图像的问题,但它们经常难以处理需要细粒度视觉细节或外部知识的复杂查询。为了获取缺失的证据,代理 VLM 调用图像裁剪、图像搜索和文本搜索等工具。然而,现有的训练范式主要根据最终答案的正确性来评估工具的使用,而对证据的获取和利用缺乏足够的监督。这导致了两个关键缺点:(i)模型经常发出冗余或偏离目标的工具调用,而无法收集必要的证据;(ii)即使调用了适当的工具,模型通常也无法从结果观察中提取必要的信息。为了解决这些限制,我们引入了 NTEP(必要工具证据路径),这是一种新颖的注释方案,它明确指定每个查询的基本外部证据和相应的工具调用。在此基础上,我们提出了NTEP-R(NTEP奖励),这是一种监督机制,确保每次工具调用都严格地将推理过程推进到最终解决方案。具体来说,我们的方法奖励代理将其呼叫前意图与必要的证据寻求目标保持一致,并确保从呼叫后观察中总结的信息与必要的证据保持一致。此外,我们引入了非重复目标正则化器来惩罚重新访问满足的 NTEP 目标的冗余调用。对七个基于图像的基准的广泛评估表明,我们的 8B 参数实例化 NTEP-8B 在统一的三工具框架内显着提高了面向搜索的准确性和工具使用效率。这些结果凸显了细粒度工具证据路径监督对于训练强大的代理 VLM 的关键价值。
