论文

共享学习率并非选择性同策略蒸馏中的中性对照

A Shared Learning Rate Is Not a Neutral Control in Selective On-Policy Distillation

模型评测评测方法与指标

摘要

选择性同策略蒸馏只在选择器评分最高的词元位置训练学生模型,既有研究常用一个共享学习率比较选择器,认为这样构成中性对照。本文发现并非如此。在GSM8K上采用LoRA、以Qwen2.5-1.5B为学生和7B模型为教师,比较跨度为8倍的学习率网格:密集监督的表现差异不显著,波动1.8个百分点,p=0.26;各选择性实验组却都随学习率改变,随机选取5%词元的组波动5.4个百分点,总变差选择器波动6.7个百分点,可教性选择器最高波动17.7个百分点。因此,密集监督与选择性监督的性能差距在学习率1e-4时为10.1个百分点,在5e-5时为5.1个百分点,相差2倍;六组成对显著性判断中有两组在相邻学习率之间翻转,尽管方法排名没有倒置。作者将此称为选择器与学习率耦合,并认为其来源是选择本身而非步长:即使各组梯度范数相差15.5倍,AdamW更新幅度仍以2.2%以内的误差跟随学习率。预注册的冻结评分消融使用初始学生模型评分,保持选择标准、预算和同策略采样轨迹不变,每个实验条件使用12个随机种子。动态评分使学习率敏感性增加3.79±1.69个百分点,p=0.035;冻结评分组仍存在显著耦合,p=0.015,说明反馈循环加剧而非产生这一现象。在既有研究实际采用的1e-6至1e-5学习率范围内,全参数微调的差异更大:密集监督波动19.8个百分点,选择性监督波动49.5个百分点,方法差距从已发表设置下不显著的3.6个百分点,增至相邻更高学习率下的34个百分点,p=0.005。在MATH-500上,LoRA实验未复现学习率依赖,限定了这一结果的适用范围,但选择性训练约10个百分点的性能损失仍然出现。论文建议把选择策略×学习率矩阵作为方法比较的前提,而非只报告一个共享学习率下的结果。