论文
您只判断一次:单次前向传递中的多响应奖励建模
You Only Judge Once: Multi-response Reward Modeling in a Single Forward Pass
摘要
我们提出了一种有区别的多模式奖励模型,该模型可以在一次前向传递中对所有候选响应进行评分。传统的歧视性奖励模型独立评估每个响应,需要多次前向传递,每个潜在响应一个。我们的方法将多个响应与分隔符连接起来,并对它们的标量分数应用交叉熵,从而实现直接比较推理和高效的 $N$ 方式偏好学习。与传统的单响应评分相比,多响应设计还可实现高达 $N\times$ 的挂钟加速和 FLOP 减少。为了使 $N$ 方式的奖励评估超越现有的成对基准,我们构建了两个新基准:(1)MR$^2$Bench-Image 包含对 8 个不同模型的响应进行人工注释的排名; (2) MR$^2$Bench-Video 是一个基于视频的大规模奖励基准,源自 94K 众包成对人类对涵盖 19 个模型的视频问答的判断,并通过偏好图集合进行去噪。两个基准均提供从完整排名中抽样的 4 响应评估变体。我们的模型建立在具有 LoRA 微调 的 4B 视觉语言主干和轻量级 MLP 值头的基础上,在六个多模式奖励基准上实现了最先进的结果,包括 MR$^2$Bench-Image、MR$^2$Bench-Video 和其他四个现有基准。我们的模型优于现有的更大的生成性和歧视性奖励模型。我们进一步证明,我们的奖励模型在与 GRPO 一起用于强化学习时,可以产生改进的策略模型,该模型可以在标准多模式基准上保持性能,同时大幅提高开放式生成质量,在训练稳定性和开放式生成质量方面都大大优于单响应判别性奖励模型(RM)基线。