论文

同策略 蒸馏 具有针对多轮代理的课程轮级指导

On-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn Agents

摘要

规划、调用工具以及与环境交互的多回合代理为解决复杂任务提供了一种有前途的范例,但它们的功能通常依赖于非常大的模型,而这些模型的推理成本在实践中是令人望而却步的。 同策略 蒸馏 (OPD) 是将这种能力转移给较小学生的自然方法,但我们发现它在这种情况下遇到了一种典型的失败模式:学生的小错误在转弯时复合,并将轨迹推离教师熟悉的状态分布,因此教师的监督在学生最需要的地方变得最不可靠。我们提出了Guided 同策略 蒸馏(Guided-OPD),这是一种简单而有效的算法,它在每条采样轨迹中混合了教师和学生生成的回合,并按照衰减到零的课程安排教师的干预概率。强指导使早期轨迹接近教师分布,然后逐渐撤回以恢复用于推理的纯粹 同策略 制度。在 ALFWorld、ScienceWorld 和 WebShop 上,从 Qwen3-30B-A3B 教师那里提取 Qwen3 学生,与普通 OPD 相比,Guided-OPD 的平均相对分数提高了 21.1%,成功率提高了 25.5%,对于较小的学生来说,提高幅度更大。