论文
RLVR²:以可验证的评分规则排序构造强化学习奖励
RLVR$^{2}$: Reinforcement Learning with Verifiable Rubric-based Ranking
摘要
可验证奖励强化学习(RLVR)正从数学、代码等有明确正确性信号的任务,扩展到由多维评分规则规定的质量要求。策略优化需要为每条采样轨迹提供一个标量,因此这类流程必须把多个评价维度的分数转成单一奖励。这种汇总常被当作简单的分数缩放,却实际决定了训练中不同质量维度的取舍。常见做法是分别归一化后线性加权,隐含假设不同维度的分数差可比较,且一项的改善能够弥补另一项的失败;当标准含义不同,这两项假设并不可靠。本文提出RLVR²,即基于可验证评分规则排序的强化学习。它对每个评价维度将分数转为组内序数结果,再从比较矩阵估计潜在效用,并将各维度效用汇总成训练信号。通过只保留组内顺序而舍弃原始分数幅度,RLVR²无需校准不同评分尺度。它还支持不改变目标的属性调整:与排名相关但不属于训练目标的辅助属性可用于估计,无需扩展评分规则或直接奖励这些属性。在三个模型规模和16项基准上,RLVR²持续优于所比较的代表性方法,并在每个规模的大多数基准上取得最佳综合表现。分析显示,它能够控制推理效率与回答格式带来的系统性影响,同时保持既定质量目标。