论文

CriPO:通过 Self-蒸馏 增强基于 Rubric 的强化学习

CriPO: Enhancing Rubric-based RL via Self-Distillation

模型训练强化学习

摘要

基于Rubric的强化学习(RL)最近在改进开放式任务的大语言模型(LLM)方面表现出了希望。基于标题的强化学习的一个被广泛认可的局限性是有限的探索:没有任何生成轨迹能够满足的标准(未探索的标准)不会收到优化信号。最近的方法通过在生成轨迹生成期间将评分标准信息作为外部指导来解决这个问题,但它们引入了训练推理不匹配:策略在外部指导下生成的生成轨迹上进行了优化,而在推理时缺少该指导,从而通过自回归解码导致错误累积。此外,这些以探索为中心的方法忽视了一种根本不同的失败模式,我们将其称为“抑制标准”——一些部署可以满足的标准,但其学习信号可能在优化过程中丢失,因为标量奖励聚合为它们分配了非正的总体优势。我们的分析表明,被抑制的标准构成了一种持续且不可忽视的故障模式——超过 25% 的样本在整个训练过程中表现出这个问题。为了同时解决未探索和抑制的标准而不引入训练推理不匹配,我们提出了标准蒸馏策略优化(CriPO),它通过 同策略 self-蒸馏 增强基于标题的强化学习。对于未探索的标准,CriPO 构建了一个行为注入教师并计算过滤后的前向 KL 损失,以将缺失的行为注入到策略中。对于被抑制的标准,CriPO 使用反事实教师在负面优势生成轨迹中定位与标准相关的标记,并纠正它们在 GRPO 中的优势以保留有用的模式。医学和科学基准实验表明,CriPO 优于现有的基于 rubric 的 RL 方法,例如,在 Qwen3-4B 上比 GRPO 平均提高 3.3 个点。