论文
SPOT:同策略 蒸馏 的稀疏探测和结果校准
SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation
摘要
同策略 蒸馏 (OPD) 为学生生成的轨迹提供密集的教师监督,但标准反向 KL 训练可能无法为其他合理的延续分配足够的概率。教师熵本身并不能揭示不确定性是集中在几个看似合理的下一个标记中还是分散在长概率尾中,也不能揭示学生是否已经很好地代表了这些候选人。此外,当地教师的概率可能无法预测下游的成功。我们引入了稀疏探测和结果校准目标 OPD (SPOT),它通过获取-探索-利用过程解决了两个耦合决策,即在哪里探测和提取什么。在获取过程中,位置级别分数结合了标准化教师熵、小型 top-k$ 候选集捕获的概率质量以及学生与教师的不匹配,以分配有限的探测预算。在探索过程中,SPOT 通过验证者评分的学生延续来评估教师提出的候选者。在利用过程中,这些结果会产生一个封闭形式的 KL 正则化目标,该目标有利于具有更好下游结果的候选人,同时保持锚定于教师分布。跨多个学生模型和推理基准的大量实验证明了 SPOT 在提高推理性能同时平衡解决方案质量和覆盖范围方面的有效性。