论文

抵达还是解决?通过检查点交接归因Agent强化学习收益

Reach or Solve? Attributing Agentic RL Gains with Checkpoint Handoffs

智能体系统模型训练强化学习Agent任务评测Agentic RL

摘要

强化学习如今训练能在真实环境中执行数十步的语言模型智能体,显著收益通常被解读为更好的决策。闭环智能体会编写自己的输入:每次观测源于此前动作,因此回合后期遇到的状态部分由自身塑造。即使任务相同,SFT与RL检查点也会从不同状态被评分。终点成功混合了两种变化:智能体抵达哪里,以及抵达后做什么。只比较两种策略都能到达的状态不能分离它们;这种限制根据结果选择样本,在我们的数据中甚至反转效应方向。我们提出检查点交接协议,复制一个已发布检查点到达的状态并交给另一检查点,无需重新训练。将SFT与RL的抵达者和解决者角色交叉,可把终点收益拆为REACH与SOLVE。REACH是策略到达环境确认距成功固定动作数的状态的频率;SOLVE是从相同复制状态完成任务的频率。在两个基准和两套独立发布流水线上,五种条件的抵达者—解决者交互均为正:同一RL历史对RL解决者比对SFT解决者更有价值。在ALFWorld上,RL改善两项指标,且不存在RL解决者失败而SFT成功的状态。独立REACH和SOLVE差距可预测总体交互。交接只要求一个检查点的历史可在另一检查点下重放,使长程评估能在终点成功率之外同时报告抵达与完成能力。

抵达还是解决?通过检查点交接归因Agent强化学习收益:论文配图
图1:内生状态问题。两个模型检查点接收同一任务后行动,早期动作使其进入不同状态,随后各自从自己产生的状态接受评分。