论文
ReGRPO:面向工具使用智能体的反思增强策略优化
ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents
摘要
工具增强视觉语言模型(VLM)可以通过调用外部工具来解决多模态、多步骤任务,但它们在实践中仍然脆弱。现有的作品有两个共同的差距。监督微调 (SFT) 主要建立在成功的轨迹上,在工具故障后几乎不提供恢复信号,而稀疏的轨迹级 RL 奖励对于哪个步骤失败以及如何修复它提供的指导有限。我们引入了 ReGRPO(反射增强组相对策略优化),这是一个学习工具使用代理中的反射引导校正的框架。 ReGRPO 从结构化反射数据引擎开始:我们执行未遂操作来收集锚定故障观察结果,然后构建思维反射三元组(ErrorType、Evidence、FixPlan)以及热启动 SFT 的纠正操作。然后,我们使用组相对优势在局部轨迹内联合优化反射标记和纠正措施,并包含反射成本项以减少不必要的反射。 GTA 和 GAIA 上的实验表明,在相同的主干和工具套件下,ReGRPO 始终优于强大的开源基线,并在比较的开源控制器中取得了最佳结果。代码和 RoT 数据可在 https://github.com/showlab/ReGRPO 获取。
