论文

将技能提炼为权重,而不是提示:抽象技能作为 同策略 自我 蒸馏 的特权信号

Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation

摘要

当轨迹组一致正确或一致错误时,具有可验证奖励的强化学习不会产生与组相关的信号,这在我们的实验中占组的 63.0-68.0%。我们提出 SKALD(技能锚定潜在 蒸馏),这是一种 同策略 自 蒸馏 框架,它使用同一 Qwen3-Base 模型的两个上下文视图:仅提问的学生和以抽象的、明确答案过滤的技能卡为条件的教师。学生根据自己的前缀进行训练,将技能带来的优势转化为共享参数,而无需在测试时进行特权输入。为了稳定上下文引起的分布不匹配,SKALD 采用退火的指数倾斜目标,以降低学生可能性极低的教师偏好标记的权重;当倾斜消失时,它会收敛到教师交叉熵并恢复前向 KL 学生梯度。仅当经过验证的执行轨迹估计出积极的教师优势时,经验门才会激活 蒸馏。在五个保留的数学基准中,SKALD 的整体 avg@8 比 GRPO 分别提高了 +2.46、+4.85 和 +12.01,分别为 0.6B、1.7B 和 4B。在 1.7B 时,仅零方差 蒸馏 恢复了全部增益的 84.7%,而 SKALD 仍比 FLOP 匹配的 GRPO 高出 +4.06,并且超出了上下文技能暴露 +3.77。这些结果表明,抽象技能提供了密集的监督,而与群体相关的奖励变得缺乏信息。