论文

提炼之前先展望一下:Agentic 同策略 蒸馏 教师指导的未来轨迹验证

Look Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy Distillation

摘要

同策略 蒸馏 (OPD) 提供教师对学生访问的状态的监督,减少训练和推理之间的分布差距。然而,在多轮代理任务中,学生偏差可能会随着时间的推移而累积,逐渐偏离教师指导仍然有效的状态。我们的定量分析进一步表明,高度分歧的状态为教师指导提供了有希望的机会,但确定这种指导是否有益需要检查其对后续学生轨迹的影响。我们提出了 FutureBridge-OPD (FTB),它在高度不一致状态下执行一个短的教师桥,并使用由此产生的学生延续来评估该桥是否增加了相对于教师的正 蒸馏 信号的密度。在 ALFWorld、WebShop 和 ScienceWorld 上,在主要 Qwen3-32B 教师到 Qwen3-1.7B 学生设置下,FTB 平均分别优于普通 OPD 和 TCOD 16.6 和 7.6 分,并且在学生规模和教师设置中仍然有效。我们的代码可在 https://github.com/ChenChiShui/FutureBridge-OPD 上公开获取。