论文

Rubric 引导的自我 蒸馏:没有 Rubric 验证器的 后训练

Rubric-Guided Self-Distillation: Post-Training Without Rubric Verifiers

摘要

在开放式领域中,Rubrics 已成为 RLVR 的替代方案,在这些领域中,单个 真值 最终答案不可用。现有的基于评分标准的训练方法依赖于 LLM 验证器,该验证器根据评分标准对每条采样轨迹进行评分。这引入了大量的训练时间开销,暴露了验证者特定偏差的优化,并减少了对稀疏轨迹末端信号的评分细则反馈。我们提出了Rubric-Guided Self-蒸馏 (RGSD),这是一种无验证者的训练方法,其中以Rubric为条件的基本策略充当无条件学生的老师。 RGSD 将标题条件下的教师分布提炼为学生的每个标记,用密集的每个标记学习信号取代稀疏的轨迹级奖励,并从训练循环中完全删除 LLM 判断。在医学和科学领域的 Qwen-2.5(3B、7B)和 Qwen3-Thinking(4B、8B)模型中,RGSD 实现了与基于判断的 GRPO 相当的评分满意度,同时每个提示使用一次 同策略 采样轨迹,并且没有训练时验证者调用。消融表明,原始评分细则比自行生成的参考答案提供了更强的教师丰富信号,而更强的 GRPO 判断在某些情况下可以胜过 RGSD,当验证者成本或可靠性成为瓶颈时,将 RGSD 定位为无验证者的补充替代方案。