论文

用于 LLM 推理的技能条件门控自我 蒸馏

Skill-Conditioned Gated Self-Distillation for LLM Reasoning

摘要

同策略 self-蒸馏 (SD) 通过使用教师端特权信息 (PI) 将稀疏验证者结果转变为密集的 词元级 监督来改进 LLM 推理。现有方法通常假设可信 PI,例如参考答案或成功跟踪。我们询问 PI 是否可以来自经验衍生的技能库,其中检索到的技能紧凑且可重用,但也可能不相关或具有误导性。我们提出技能条件门控自我 蒸馏 (SGSD),它将基于技能的 SD 作为教师假设验证而不是无条件模仿。 SGSD 检索技能-错误对,构建多教师池,并让所有具备技能条件的教师对相同的简单快速的学生展示进行评分。验证者验证每个教师的极性:支持成功或抑制失败给出积极的监督,而相反的立场则相反。然后,强大的门控目标可以提炼出信息丰富的师生分歧,同时抑制不确定或极端的信号。对多个数学推理基准的实验表明,SGSD 始终优于 GRPO,并且在较弱 PI 假设下与答案条件 OPSD 保持竞争力。例如,在 Qwen3-1.7B 上,SGSD 在 AIME24、AIME25 和 HMMT25 上平均优于 GRPO 6.2%,优于 OPSD 1.7%。