论文
TAPO:经信用转移的面向工具多模态搜索的策略优化
TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents
摘要
我们将信用错误分配识别并正式描述为工具增强多模态搜索代理中 GRPO 的系统性失败模式:它向所有词元统一广播轨迹级优势,导致失败轨迹中有价值的工具使用步骤受到与无价值轨迹相同的惩罚。我们进一步根据经验量化了这种现象的规模。超过一半的失败轨迹和失败的工具使用动作表现出可纠正的信用错误分配,这表明浪费的训练信号既大量又在结构上可利用。基于这一见解,我们提出了工具感知策略优化(TAPO),它利用了信息获取工具的参数确定性属性:相似的调用参数定义了等效的信息获取操作,因此应该共享可比的操作信用。 TAPO 在当前训练批次中构建反事实见证,并通过置信门控保守优势修正来补偿错误分配的负信用。它不需要额外的注释、模型或采样,并且引入的计算开销可以忽略不计。在多个多模态搜索基准测试中,TAPO 在三种主流 RL 算法(GRPO、GSPO 和 SAPO)的强大基线上提供了一致、即插即用的改进。我们的代码和模型将在接受后公开发布。
