论文
无需搜索即可锐化:序列级幂分布的在策略蒸馏
Sharpen Without Search: On-Policy Distillation of Sequence-Level Power Distribution
摘要
语言模型赋予正确答案的概率可能高于任意一个错误答案,却仍通常采样到错误答案,因为所有错误答案合计的概率更高。幂分布将每个完整答案的概率提升到大于1的幂次后重新归一化,把概率集中到模型认为最可能的答案,即锐化。从中采样无需改变参数即可改善推理,但每次查询需要大量已评分候选。我们表明,可以训练模型,通过一次生成直接产生这样的答案。在策略幂分布蒸馏(OPPD)运行序贯蒙特卡洛采样器:受训模型生成候选,冻结教师模型的幂分布为候选加权;最大似然更新也使用相同概率为各答案加权。在相同温度下,相较未训练模型,训练将单次生成准确率在MATH500上最高提高23.0分,在GSM8K上最高提高27.3分。单次生成分别比已发表的64候选幂分布采样高2.4和3.5分,获得未训练模型使用16候选时收益的94%。作为参照,相较从相同检查点出发、使用相同预算和可验证奖励训练的GRPO,OPPD无需参考答案,在MATH500、GSM8K和AIME上分别高3.8、4.0和5.4分。两者互补,在GRPO后应用OPPD最高再增加9.3分。仅在数学上训练的OPPD,使HumanEval准确率最高提高5.3分。通过一个损失系数,可将模型吸收的锐化指数调至1.19—2.02,而普通在策略蒸馏为1.14;该指数主要在模型自己的答案上提高。收益在不同模型系列和规模上保持,包括已用可验证奖励训练的模型:降低温度没有收益,OPPD仍在MATH500上提高4.4分。代码:https://github.com/ArminAzizi98/OPPD.