论文

在分歧处本地化信用:用于 LLM 推理的路径条件自我 蒸馏

Localizing Credit at the Divergence: Path-Conditioned Self-Distillation for LLM Reasoning

摘要

来自可验证奖励的强化学习为每条采样轨迹分配一个标量,从而使 词元级 贡献分配在长推理跟踪中未指定。 同策略 自蒸馏 通过让同一模型充当以特权信息为条件的教师来解决这个问题,产生密集的每个词元信号。但 真值 答案的常见选择只是一个终点提示:在简洁答案任务中,教师在路径级指导最重要的中间位置保持沉默。我们提出了事后诸葛亮自我 蒸馏 (HSD),这为教师从当前训练组中成功进行同伴展示奠定了条件。这样的对等点是成功条件策略的精确样本,不需要额外的采样部署。通过提供完全成功的延续而不仅仅是最终答案,产生的信用信号集中在失败的采样轨迹和成功的同行之间的分歧位置。在 Qwen3-8B 和 Qwen3-32B 的数学和代码基准测试中,HSD 相对于 GRPO 变体和 同策略 蒸馏 基线获得了最佳结果,在 AIME 等简洁答案任务上收益最大。