论文
带前缀重播的多回合 同策略 蒸馏
Multi-Turn On-Policy Distillation with Prefix Replay
摘要
我们研究用于代理任务的 同策略 蒸馏 (OPD),其中 LLM 代理与环境进行多轮交互,学生在这些多轮交互历史中模仿老师。完全在线的 OPD 成本高昂,因为每次更新都需要新的学生在环境中进行展示,并要求教师查询访问过的历史记录。我们提出了 Replayed-Prefix 同策略 蒸馏 (ReOPD),这是一种脱离环境的替代方案,可重复使用预先收集的教师轨迹作为重播前缀:学生按照选定的步骤进行操作,而教师则提供密集的每步监督,而无需执行新的环境交互。我们表明,多轮OPD引入了一个前缀陷阱:使历史更加学生-同策略提高了与学生的相关性,但可以向老师询问其目标不可靠的历史。这造成了学生占用率和教师可靠性之间的双向分布变化。 ReOPD 通过将多轮 OPD 视为可靠性感知的前缀分布设计来解决此问题,并通过强调早期、较低移位前缀的简单步进衰减采样计划来实现它。在使用 Python 进行数学推理以及多个教师和学生模型规模的搜索环境中,ReOPD 保留或提高了 OPD 级别的准确性,在学生训练期间使用零工具调用,并且每条轨迹采样速度比 OPD 至少快 4 倍。因此,ReOPD 将昂贵的代理与环境交互转变为可重用的离线资源,从而实现跨工具、任务和环境的可扩展 蒸馏。