论文

闭合反思缺口:智能体RL的免费校准红利

Closing the Reflection Gap: A Free Calibration Bonus for Agentic RL

模型训练强化学习Agentic RL

摘要

LLM 越来越多地被部署为与外部环境交互并观察执行结果、错误消息和工具输出等反馈的代理。运作良好的代理应该能够利用这些反馈来准确评估自己的表现。然而,我们发现了一个持续存在的反思差距:LLM 代理在观察具体的环境反馈后往往会错误地评估自己的输出——即使是他们正确回答的问题——而标准强化学习由于学分分配不匹配而几乎没有帮助。为了弥补这一差距,我们提出了 RefGRPO,这是一种简单而有效的解决方案,它通过两个关键要素增强了标准 RL 算法:通过将代理自身的反映与实际结果进行对比来计算的免费校准奖励(不需要额外的奖励模型、LLM 判断或外部注释),以及其系数的动态时间表。与标准 RL 基线相比,我们的方法在五个基准测试中同时改进了文本到 SQL 的反射校准(例如,将信心不足率从 $44.4\% \ 降低到 7.7\%$)和任务准确性(例如 $75.1\% \ 到 76.5\%$)。由此产生的校准反射将代理转变为基于环境反馈的自己的验证者,这进一步实现了(i)更好的自我改进,在没有结果监督的情况下使用反射作为伪奖励,以及(ii)通过仅承诺标记为正确的推出来更有效的测试时间选择​​性预测。