论文
TACO:针对代理工具使用的工具增强信用优化
TACO: Tool-Augmented Credit Optimization for Agentic Tool Use
摘要
代理多模态模型通过代码和对返回视图的推理对图像执行多种操作,这是细粒度视觉问答的有效范例。然而,代码操作可能是有用的、多余的或误导性的。仅结果奖励无法精确区分这些情况,并且现有的流程奖励要么无法将最终正确性归因于各个工具调用,要么需要外部判断模型。为了解决这个问题,我们引入了工具增强信用优化(TACO),这是一种构建在两个耦合优势通道上的代码工具代理的 GRPO 变体。第一个是差异答案探测奖励(DAPR),是一种自我监督、无需判断的工具贡献优势,它根据每个工具调用本身对正确回答的影响来奖励它。插入模型推理中的探测标记会在使用和不使用工具的情况下引发预测,结果奖励的差异被视为调用的值:正值表示有用的调用,负值表示误导性的调用,零表示没有任何改变的调用。这重用了现有的答案检查器,没有辅助判断,并且作为差异而不是绝对的探测分数,自然对探测黑客攻击具有鲁棒性。第二个是来自最终答案的结果优势,由结果门控优势路由 (OGAR) 分配:一种无参数规则,以调用结果为条件,仅将此信用值传递给负责的部分,从而抑制浪费的工具调用,而无需任何成本项。我们通过两级 SFT+RL 管道训练 TACO。跨感知、推理和一般多模式基准的广泛实验表明,它能产生一致的准确性增益,并且只有在工具有帮助时才学会调用它们。