论文

OmniOPD:logits-Free 同策略 蒸馏(通过推测性验证)

OmniOPD: Logit-Free On-Policy Distillation via Speculative Verification

摘要

同策略 蒸馏 (OPD) 在来自更强教师的密集 词元级 反馈下,在自己的生成轨迹上训练学生模型,从而减轻监督 微调 (SFT) 的 离策略 分布偏移和强化学习 (RL) 的稀疏学分分配。然而,标准 OPD 面临两个相互关联的限制。首先,它需要直接访问教师的 词元级 logits,排除一大类有能力的专有模型来担任教师。其次,词元级 logits 信号本身很脆弱,取决于教师和学生之间合理的下一个标记的狭窄重叠,并且容易放大退化模式,例如重复循环。在本文中,我们介绍了 OmniOPD,这是一种新颖的框架,它通过无 logits 的块级监督信号解决了这两个限制。 OmniOPD 用蒙特卡洛执行轨迹取代了确定性 logits 匹配,蒙特卡洛执行轨迹通过多标记块上的连续语义相似性度量来近似教师的本地偏好,并通过峰值熵调度程序集中这种监督,该调度程序仅在其高不确定性推理分支处审核学生。狄利克雷多项式贝叶斯先验和基本模型 KL 锚进一步限制了离散采样的方差,并防止未经审计的词元的策略崩溃。在竞争性基准测试中,OmniOPD 在数学上超越标准 OPD 方法高达 +28.64%,证实块级语义验证提取的学习信号比 词元级 logits 匹配更可靠,后者的高信息密度被显着的噪声和脆性所抵消。此外,当与 Claude-4.5-Haiku 和 Gemini-2.5-Flash 等更强大的黑盒教师配合使用时,OmniOPD 的数学成绩比开放权重教师对手额外提高了 9.54%,使学生超越了自我探索 RL 的表现。