论文
TIP:同策略蒸馏中的词元重要性
TIP: Token Importance in On-Policy Distillation
摘要
同策略知识蒸馏(OPD)使用学生模型自身生成的轨迹,并由教师提供词元级监督。不同词元位置的重要性并不相同,现有解释也不完整。本文研究哪些词元在OPD中包含最有用的学习信号,发现有两类位置:学生熵较高的位置,以及学生熵较低但师生分歧较大的位置;后一类对应学生高度自信却作出错误判断。实证结果表明,学生熵是有效的一阶代理指标:按熵采样保留50%的词元,效果达到或超过使用全部词元训练,同时峰值显存最高减少47%。但仅使用熵会漏掉第二类重要位置。单独选取低熵、高分歧词元,用不足全部词元10%的数据训练,效果也接近全词元基线,表明过度自信的错误词元具有密集的纠错信号。本文提出TIP,以学生熵和师生分歧构成二维分类体系,并从理论上解释熵指标为何有效、又为何不够完整。这一分析推动了同时考虑不确定性和分歧的词元选择规则。研究在涵盖Qwen3、Llama和Qwen2.5的三对师生模型上,使用MATH-500、AIME 2024/2025以及长程Agent规划基准DeepPlanning验证该结论。在DeepPlanning中,仅使用Q3区域不足20%的词元训练,即超过全词元OPD。实验扩展了OPD仓库https://github.com/HJSang/OPSD_OnPolicyDistillation,支持在有限GPU预算下对较大模型进行显存高效的蒸馏。