论文

STRIDE:通过自适应停止与前缀重启加速多轮智能体同策略蒸馏

Know When to Stop, Where to Restart: Accelerating Multi-Turn Agentic On-Policy Distillation

摘要

同策略蒸馏 (OPD) 已成为将能力从大型教师转移到小型学生的标准方法。然而,其成本主要由自回归学生的采样轨迹所主导,并且在多轮代理环境中扩展性很差。尽管轨迹内和轨迹之间的教师信号可靠性存在很大差异,但现有的加速方法会根据固定的离线预算截断或重新定位监督信号。我们对 $τ^2$-bench 的实证分析揭示了这种变化的清晰结构:信息监督集中在每个回合的前缀中,最重要的是,对于多回合代理训练,教师认可的交叉回合损失暂时锁定在学生的第一个错误动作上,而不是在回合中逐渐累积。基于这些发现,我们提出了 STRIDE(停止并重新启动策略蒸馏加速),它结合了两种互补技术:自适应早期停止,一旦累计教师对数概率低于分布阈值,就终止采样轨迹;前缀缓冲区,缓存高质量前缀并在最弱的正确回合重新启动生成。这些机制共同引发了数据驱动的课程,逐步将覆盖范围扩展到以后的阶段。在$τ^2$-bench零售上,我们的方法匹配全轨迹OPD,并以$3.73\times$加速超过30B教师,以$2.34\times$超越基线本身,并在跨域多教师训练下保留$4.51\times$加速。作为超越代理设置的补充泛化测试,STRIDE 在 AIME 2025 上以 $5.10\times$ 加速优于完全 OPD,在 AIME 2024 上以 $3.08\times$ 加速优于完全 OPD;对两次评估进行平均后,两项固定预算截断基线仍低于全部 OPD。