论文

先思考,然后评分:视频奖励模型的解耦推理和评分

Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling

模型训练奖励建模与过程监督

摘要

生成视频模型的最新进展越来越多地受到 后训练 和测试时间缩放的推动,这两者都严重依赖于视频奖励模型 (RM) 的质量。理想的奖励模型应该预测准确的奖励,与不同场景下的人类偏好相一致。然而,现有的范式面临着一个根本性的困境:\textit{Discriminative RMs} 直接在多模态 大语言模型 (MLLMs) 提取的特征上回归奖励,而没有明确的推理,这使得它们容易进行捷径学习,并且严重依赖于大规模数据扩展来进行泛化。相比之下,具有思想链(CoT)推理的 \textit{Generative RMs} 表现出卓越的可解释性和泛化潜力,因为它们利用细粒度的语义监督来内化人类偏好背后的基本原理。然而,由于单个自回归推理链中推理和评分的耦合,它们面临着固有的优化瓶颈。为了利用 CoT 推理的泛化优势,同时减轻耦合推理和评分的训练不稳定性,我们引入了 DeScore,一种训练高效且可泛化的视频奖励模型。 DeScore 采用解耦的“思考然后评分”范例:MLLM 首先生成显式 CoT,然后是一个专用的判别评分模块,该模块由可学习的查询标记和预测最终奖励的回归头组成。 DeScore 通过两阶段框架进行优化:(1) 区分性冷启动,结合随机掩码机制以确保强大的评分能力,(2) 双目标强化学习阶段,独立完善 CoT 推理质量并校准最终奖励,确保更高质量的推理直接转化为卓越的模型性能。