论文
TCOD:探索 同策略 蒸馏 中的多轮自治代理的时间课程
TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents
摘要
同策略 蒸馏 (OPD) 在将推理能力从前沿或特定领域模型转移到较小的学生方面表现出了强大的潜力。虽然对静态单轮任务有效,但其在多轮代理设置中的行为仍未得到充分研究。在这项工作中,我们确定了这种情况下普通 OPD 的一个关键限制,我们将其称为轨迹级 KL 不稳定性。具体来说,我们观察到 KL 散度随着成功率的下降而增加,即使在收敛后,KL 仍然很高,导致训练不稳定。这种不稳定性是由轮间误差复合引起的:随着误差的累积,学生会超出老师的有效支持,从而导致监督信号不可靠。为了解决这个问题,我们提出了 TCOD(时间课程 同策略 蒸馏),这是一个简单而有效的框架,可以控制向学生展示的轨迹深度,并通过课程安排逐步将其从短到长扩展。四对师生在三个多回合智能体基准(ALFWorld、WebShop、ScienceWorld)上的实验结果表明,TCOD 可以减轻 KL 升级并增强整个训练过程中 KL 的稳定性,与普通 OPD 相比,智能体性能提高了 18 个百分点。进一步的评估表明,TCOD 甚至可以超越教师的表现,并推广到教师失败的任务。我们的代码可在 https://github.com/kokolerk/TCOD 获取。