论文
视频理解奖励模型:稳健的基准和绩效奖励模型
Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models
摘要
多模式奖励模型在文本和图像领域取得了长足的进步,但由于缺乏可靠的评估基准和高质量的偏好数据,视频理解奖励模型的进展仍然受到严重限制。为了解决这个问题,我们提出了一个涵盖基准设计、数据构建和奖励 模型训练 的统一框架。我们引入了视频理解奖励基准 (VURB),这是一个基准,具有 2,100 个偏好对,具有长链思维推理轨迹(平均 1,143 个词元)以及针对一般、长和推理导向的视频任务的多数投票评估。我们通过全自动管道进一步构建视频理解偏好数据集(VUP-35K),为视频奖励训练提供大规模高质量监督。基于这些数据,我们训练了 VideoDRM 和 VideoGRM,这是一种判别性和生成性奖励模型,两者都在 VURB 和 VideoRewardBench 上实现了最先进的性能。进一步的分析证实,VUP-35K 增强了奖励性能和模型推理能力,而 VideoDRM 和 VideoGRM 在 best-of-$N$ 测试时间扩展下产生了显着的收益。