论文
通过测试时间缩放的视角来理解 同策略 蒸馏
Towards Understanding On-Policy Distillation through the Lens of Test-Time Scaling
摘要
同策略 蒸馏 (OPD) 已成为一种有前途的 后训练 技术,用于增强 LLM 推理。在反向 KL 目标下,OPD 的理想化最优值使学生分布与教师分布保持一致。当老师的表现始终优于学生时,这自然表明 OPD 应该比 OPD 前的学生产生广泛的进步。然而,这种改进是否扩展到整个测试时间采样预算范围?在这项工作中,我们通过改变采样预算 $K$ 并通过 pass@$K$ 评估性能,从测试时间缩放的角度重新审视这一期望。在多种设置中,我们观察到两种不同的模式:OPD 可以在小样本预算和大样本预算下提高 pass@$K$,但它也可以提高小预算性能,同时减少大预算 pass@$K$。我们展示了保证这种逆转的一个条件和一个理想化的反向 KL 反例,即使老师对每个问题都有更高的准确性,它也会发生。为了在目标抽样预算下在两名候选教师之间进行选择,我们提出了 \textit{Teacher Advantage Score at $K$} (TAS@$K$),可以在 OPD 训练之前计算该分数,以预测哪位教师将在 pass@$K$ 方面带来更大的改进。在三个领域和十三个基准中,TAS@$K$ 预测的排序与在 83.6% 的实验中观察到的结果 OPD 模型的 pass@$K$ 改进一致,为目标 pass@$K$ 的教师选择提供了有用的信号。