论文
活化条件自蒸馏
Activation-Conditioned Self-Distillation
摘要
on-policy自蒸馏使用模型作为自己的老师,通常通过参考解决方案调节来为推理提供密集的监督。提供特权信息本身并不能确保在整个长响应过程中进行有效的词元级监督。我们引入了激活条件自蒸馏(ACSD),它通过对比在生成预算内达到经过验证的正确答案的自生成轨迹的激活与所有剩余轨迹的激活来提取转向向量。基本模型的冻结副本在每个预测位置应用此向量,并且学生从学生生成的前缀上的下一个标记分布中学习。结果验证用于方向构建和校准;蒸馏既不需要针对特定问题的参考文本,也不需要更新教师参数。蒸馏学生单独用于推理。在五个模型中,ACSD 在评估方法中的四个数学基准上均实现了最高的平均准确度。在 DeepSeek-R1-0528-Qwen3-8B 上,平均数学准确度达到 71.9\%,LiveCodeBench v6 pass@12 达到 70.9\%,而参考条件 OPSD 基线的平均数学准确度为 69.0\% 和 66.3\%。正确轨迹之间的对比也支持蒸馏,并且提取的方向可以在数学训练数据集中重复使用。在固定的学生轨迹上,ACSD 比 OPSD 保持更稳定的后期 logit 更新幅度。