论文

PivotOPD:学习从多轮Agent的关键错误中恢复

PivotOPD: Learning to Recover from Pivotal Mistakes in Multi-Turn Agents

摘要

在策略蒸馏(OPD)是一种很有前景的语言Agent训练方法,可以为学生生成的轨迹提供密集的教师监督。然而,在多回合交互中,不正确的动作会改变学生稍后遇到的状态,因此错误会在回合之间复合。在三个 Qwen3 模型(8B 到 235B)的初步实验中,我们发现超过一半的失败部署都包含一个关键错误,即使智能体距离完成任务更远的动作,并且这种错误通常很早就发生。这些关键错误通常仍然是可以恢复的:在关键转弯后仅引导模型几圈就可以恢复任务的成功。因此,我们提出了 PivotOPD,这是一个在on-policy蒸馏框架,可以共同训练学生防止关键错误并从他们造成的状态中恢复。对于每个关键错误,教师模型都会提供一个黄金动作,然后在接下来的几个回合中指定一个恢复动作。预防性蒸馏使用反向 KL 的黄金动作来引导学生远离关键错误,而恢复蒸馏使用正向 KL 的恢复动作来转移学生很少尝试的恢复行为。与 ALFWorld、WebShop 和基于搜索的 QA 上的 13 个基线相比,PivotOPD 为 Qwen3-1.7B 和 Qwen3-8B 学生实现了最强的平均表现,比 ALFWorld 上最强基线的 1.7B 学生提高了 +5.5%。这些成果还转移到了软件工程领域的另一个模型系列,其中 PivotOPD 将 SWE-Bench Verified 上 Nemotron-3.5 学生的解析率提高了 3.2%。项目页面:https://research.nvidia.com/labs/lpr/pivotopd/