论文

重温LLM-Agents时代的DAgger

Revisiting DAgger in the Era of LLM-Agents

模型训练监督微调与指令调优

摘要

长视野 LM 智能体从多轮交互中学习,其中一个早期错误可能会改变随后的状态分布并破坏整个轨迹。现有的方法在互补方面存在不足:有监督的 微调 提供了密集的教师监督,但由于它是在 离策略 教师轨迹上进行训练而遭受协变量偏移的影响;而具有可验证奖励的强化学习通过从 同策略 采样轨迹中学习来避免这种 离策略 不匹配,但只有稀疏的结果反馈。我们通过重新审视多轮 LM 代理的数据集聚合 (DAgger) 来解决这一困境:该算法通过学生和教师策略的轮级插值来收集轨迹,然后使用教师提供的监督标签对学生进行这些轨迹的训练。通过直接与环境交互,我们将模型暴露在部署过程中可能遇到的现实状态,从而有效地减轻协变量偏移。此外,由于学生是通过模仿老师的行为来学习的,因此在学习过程中会收到丰富的反馈。为了证明 DAgger 兼具两全其美的优势,我们测试了该算法,以使用 4B 和 8B 规模的学生模型训练软件工程代理。在 SWE-bench Verified 上,我们的 DAgger 式训练比最强的 后训练 基线在 4B 上提高了 +3.9 分,在 8B 上提高了 +3.6 分。由此产生的 4B 代理达到 27.3%,优于已发布的代表性 8B SWE 代理系统,而 8B 代理达到 29.8%,超过 SWE-Gym-32B,与更强的 32B 规模代理相差不到 5 个百分点。加上坚持不懈的 SWE-Gym 分裂的持续收益,这些结果表明 DAgger 对于现代长视野 LM 智能体的有效性。