论文
使监督匹配学生的学习能力:在策略自蒸馏的统一框架
Matching Supervision to the Student's Learning Capacity: A Unified Framework for On-Policy Self-Distillation
摘要
在策略自蒸馏(OPSD)通过自蒸馏将特权上下文内化到模型参数中,以提升大语言模型的推理能力。近期两条研究路线分别通过选择从哪些token学习、控制教师接收多少特权信息来改进朴素OPSD。然而我们证明,每条路线都在固定另一变量的情况下优化其中一个变量,导致次优解。我们论证这两个变量通过学生的学习能力耦合:特权信息设定教师规定的每token散度,而token加权选择学生必须吸收其中哪些。我们将两条工作路线形式化为统一优化框架:在学生可吸收的总学习难度预算约束下,最大化教师-学生的总散度。在此建模下,我们提出统一在策略自蒸馏(USD),一种求解拉格朗日式的轻量在线算法。USD揭示单一对偶变量同时支配这两个决策:在单一学习难度价格下,它同时设定token选择阈值和特权信息调整方向,使监督始终匹配学生不断演进的能力。大量实验表明,USD在多个推理基准和各种模型规模上始终优于OPSD及token侧与特权信息侧基线。代码发布于 https://github.com/lauvlalala/USD。
