论文

MatrixReward:Rubric Matrix 对开放式生成的奖励

MatrixReward: Reward from Rubric Matrix for Open-Ended Generation

模型训练奖励建模与过程监督

摘要

开放式查询生成缺乏标准答案,因此需要有效的奖励机制。逐点评分规则提供了有关同一提示下样本答案相对质量的有限信息;将多个评分标准的判断合并为一个分数也可能掩盖这些答案之间的差异。我们提出了 MatrixReward,它通过比较每个标题下的每对采样响应而获得的按标题获胜率矩阵构建奖励。每个矩阵列的分布反映了该标题区分当前rollout的程度,而列之间的相关性则揭示了标题的重复性;这些统计数据共同产生依赖于数据的标题权重。我们将这些权重与之前的评分标准权重结合起来。经过列归一化和加权后,观察到的每个标题的最大值和最小值定义了正和负的理想轮廓。每次部署与这两个理想的距离决定了其相对接近的质量奖励。使用 Qwen3-8B 在四个开放式查询回答基准上进行评估,MatrixReward 的平均得分为 63.02,比最强基线高出约 2.0%。这些结果支持这样的观点:从相对比较中得出的矩阵可用于为开放式生成强化学习更合理地构建奖励。