论文
QUBRIC:共同设计强化学习的查询和评分标准,超越可验证的奖励
QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards
摘要
基于Rubric的强化学习是将强化学习扩展到可验证奖励之外的一种很有前途的途径,但现有的方法在将查询分布视为固定的同时优化了Rubric。我们确定了一个结构瓶颈:标题质量受到查询结构的限制。开放式查询会产生模糊的标题;天真地缩小它们的范围引入了任何模型都无法验证的捏造参考,因此所有响应都会失败,并且训练不会收到奖励信号。我们提出了 QUBRIC,一个共同设计查询和评分标准的框架。教师提出的要点将开放式查询重写为基于场景的可评估问题。然后,对比标题生成将教师政策差距转变为查询级别标准,并且可学习性过滤仅保留用于 GRPO 训练的信息丰富的查询标题对。 QUBRIC 在 ArenaHard 上比 SFT 基线提高了 +5.5 点。仅根据指令跟踪数据进行训练,它进一步转移到跨越法律、道德和叙事推理的三个保留基准(平均+6.3分),改进集中在推理相关维度。这些结果证明,共同设计查询和评分标准可以使基于评分标准的强化学习成为 RLVR 的实际补充,超越严格可验证的任务。