论文
CoRT:面向token级评分准则引导策略优化的反事实重放
CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization
摘要
基于评分准则(rubric)的强化学习通过依据显式标准评估模型输出,丰富了语言模型训练。然而在GRPO式流水线中,这些结构化判定被压缩为标量的响应级奖励,并转换为响应级优势,均匀广播到所有生成的token。这使得响应内部的信用分配没有显式机制,即使不同标准分别锚定于不同片段、格式决策或语义选择。我们提出CoRT,一种面向评分准则条件化GRPO的token级信用加权方法。CoRT不训练辅助的token打分模型,而是使用反事实重放,在原始的准则条件提示与匹配的无标准提示下对同一条采样响应重新打分。由此得到的逐token对数似然对比可作为对准则上下文依赖程度的代理。CoRT将这些对比映射为有界、按响应归一化的权重,并用它们在token间重新分配带符号的GRPO优势,既不引入辅助打分器,也不改变响应级奖励。在指令微调模型与不同奖励粒度上的实验表明,CoRT在绝大多数对比中优于匹配的响应级GRPO,平均提升4.4个百分点。该方法与学习型token级信用基线保持竞争力,同时避免了单独的相关性学习阶段。这些结果表明,策略内部的反事实似然对比为响应内信用分配提供了有效的训练信号,同时保留了GRPO的简洁与稳定。
