论文

基于强化学习的半监督 知识蒸馏 和 LLM-as-a-Judge

Reinforcement Learning-based Semi-supervised Knowledge Distillation with LLM-as-a-Judge

模型训练奖励建模与过程监督

摘要

强化学习(RL)极大地提高了语言模型的推理能力,但大多数现有的 RL 微调 方法完全依赖于 真值 可验证的奖励,从而用可验证的答案标记数据集。为了克服这个问题,我们提出了一个用于推理 蒸馏 的 RL 框架,该框架利用连续的、基于 LLM 的奖励。我们的方法采用一种有效的机制,直接从法官 LLM 的单词元 logits 计算连续 CoT 奖励(CCR),评估学生模型的推理轨迹。该公式提供了有效且可扩展的在线训练信号,可应用于大量未标记数据。我们证明,当与强大的法官配合使用时,简单地使用 CCR 即可实现与 真值 或伪标签可验证奖励相当的性能,甚至随着未标记数据量的增加而超越它们。此外,我们发现将它们组合在半监督设置中具有高度协同作用:可验证的奖励有助于稳定 CCR,而 CCR 则提高了可验证奖励对相关任务的泛化性。我们还提供了跨多个模型架构和数据集大小的各种奖励来源的全面实证比较。我们的结果表明,这种半监督方法持续增强了数学推理,在多项推理任务上产生了 5-10% 的绝对改进。