论文
自适应 FastOPD:进度感知轨迹长度扩展,实现高效 同策略 蒸馏
Adaptive FastOPD: Progress-Aware Rollout Horizon Expansion for Efficient On-Policy Distillation
摘要
同策略 蒸馏 (OPD) 沿着学生生成的轨迹提供密集的教师监督,但其在线轨迹采样过程会产生大量的计算成本,特别是当一些长响应延迟批量完成时。现有的加速方法通常使用固定预算或绝对师生一致性阈值来控制轨迹长度,这可能无法反映不同模型和训练阶段的学习进度。我们提出了自适应 FastOPD,这是一种进度感知策略,仅当当前边界区域附近的学习趋于稳定并且当前范围得到充分利用时,才会扩展轨迹长度。前者是根据进入每个轨迹长度阶段时相对于其值测量的四个教师-学生信号确定的,从而使扩展响应于特定于阶段的进度,而不是预定义的步骤间隔或原始协议信号的绝对阈值,而后者则防止少量长响应触发轨迹采样成本的增加。在两个师生对中,Adaptive FastOPD 实现了最高的平均性能,同时相对于 OPD 15K 减少了 49.1--71.2% 的训练时间,并且在一系列超参数设置下保持稳健。