论文

ReGRPO:面向工具使用智能体的反思增强策略优化

ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents

模型训练强化学习Agentic RL

摘要

工具增强视觉语言模型(VLM)可以通过调用外部工具来解决多模态、多步骤任务,但它们在实践中仍然脆弱。现有的作品有两个共同的差距。监督微调 (SFT) 主要建立在成功的轨迹上,在工具故障后几乎不提供恢复信号,而稀疏的轨迹级 RL 奖励对于哪个步骤失败以及如何修复它提供的指导有限。我们引入了 ReGRPO(反射增强组相对策略优化),这是一个学习工具使用代理中的反射引导校正的框架。 ReGRPO 从结构化反射数据引擎开始:我们执行未遂操作来收集锚定故障观察结果,然后构建思维反射三元组(ErrorType、Evidence、FixPlan)以及热启动 SFT 的纠正操作。然后,我们使用组相对优势在局部轨迹内联合优化反射标记和纠正措施,并包含反射成本项以减少不必要的反射。 GTA 和 GAIA 上的实验表明,在相同的主干和工具套件下,ReGRPO 始终优于强大的开源基线,并在比较的开源控制器中取得了最佳结果。代码和 RoT 数据可在 https://github.com/showlab/ReGRPO 获取。

ReGRPO:面向工具使用智能体的反思增强策略优化:论文配图
图 1:结构化反射数据引擎的管道。给定任务轨迹,我们首先引发工具故障(例如,面部图像上的 OCR 返回空文本)。然后,教师模型(默认为 GPT-4o)生成具有显式 ErrorType、Evidence 和 FixPlan 的结构化思维反思,解释失败并提出下一步操作(例如,切换到面部检测)。代理执行更正的操作以恢复并完成任务。此错误、反射和纠正循环将原始故障转换为锚定监督以进行恢复。