论文
联合奖励建模:将思维链内化以构建高效视觉奖励模型
Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models
摘要
奖励模型对基于人类反馈的强化学习(RLHF)至关重要,因为它们决定着生成模型的对齐质量与可靠性。对于图像编辑等复杂任务,奖励模型需要捕捉超出局部相似性的全局语义一致性与隐式逻辑约束。现有奖励建模方法存在明显局限。判别式奖励模型与人类偏好对齐良好,但由于推理监督有限而难以处理复杂语义。生成式奖励模型具备更强的语义理解与推理能力,但推理时代价高昂,且难以直接与人类偏好对齐。为此,我们提出联合奖励建模(JRM),在共享的视觉-语言骨干上联合优化偏好学习与语言建模。这一方法将生成模型的语义与推理能力内化到高效的判别式表示中,实现快速而准确的评估。JRM在MMRB2与EditReward-Bench上取得最优结果,并显著提升下游在线强化学习的稳定性与表现。这些结果表明,联合训练有效弥合了奖励建模中效率与语义理解之间的鸿沟。
