论文
$\boldsymbol{f}$-OPD:通过新鲜度感知控制稳定长视野 同策略 蒸馏
$\boldsymbol{f}$-OPD: Stabilizing Long-Horizon On-Policy Distillation with Freshness-Aware Control
摘要
为 大语言模型 (LLM) 扩展 同策略 蒸馏 (OPD) 面临着根本性的紧张:异步执行对于系统效率来说是必要的,但在结构上偏离了理想的 同策略 目标。为了应对这一挑战,我们从理论上将客观差异分解为采样轨迹漂移和监督漂移,分别捕获学生采样轨迹和教师环境中的陈旧性。在此基础上,我们引入了样本级新鲜度评分,用于量化缓冲样本相对于 同策略 目标的可靠性。在此信号的指导下,我们进一步提出了 f-OPD,这是一种新颖的框架,可以自适应调节过时样本的影响并限制异步训练下累积的策略漂移。在增加交互范围的推理、工具使用和编码代理任务中,f-OPD 始终如一地实现与同步优化相当的任务性能,同时在很大程度上保留了异步执行的吞吐量优势。我们的结果确立了在 OPD 中实现性能与效率权衡的第一个秘诀,为长期大规模代理 后训练 铺平了道路。