论文

Z-Reward:通过将推理内化到分数分布中来超越标量奖励

Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions

模型训练奖励建模与过程监督

摘要

奖励模型是文本到图像 后训练 的核心,但视觉偏好是主观的,并且更好地表示为评分标准分数的分布,而不是确定性标量。现有的标量、分数词元和成对奖励模型过度压缩了不确定性和细粒度的分数差异,而基于推理的生成奖励提供了更强的判断,但部署成本高昂且难以用作直接优化信号。我们提出了 Z-Reward,一种师生奖励建模框架,它将大量推理判断与有效奖励部署分离开来。教师是一个大型 VLM,使用推理来推断与标题对齐的分数分布,并接受分组直接分数优化 (GDSO) 训练,该优化将来自分布期望的策略梯度奖励与对分数分布和分数差距的直接逐点和成对监督相结合。学生接受推理内化分数 蒸馏 (RISD) 的训练,它将教师的推理条件分数分布转移到紧凑的 VLM 中,而无需在推理时显式推理链。在我们内部注释的评估集上,27B GDSO 教师达到了 89.6% 的人类偏好准确率,优于 SFT、RewardDance 和 GRPO,而 9B RISD 学生则达到 88.6%,优于 OPD 基线,与较大的教师密切匹配。我们进一步表明,Z-Reward 可以作为文本到图像优化的可微奖励信号,与 SFT 基线相比,人类偏好净值提高了 41.3%。