论文
WorldReward:相机条件世界模型的奖励建模
WorldReward: Reward Modeling for Camera-Conditioned World Models
摘要
相机调节的世界模型生成交互式视频,其中命令的动作应引起预期的场景变化,同时外观、几何形状和时间动态保持一致。现有的奖励单独评估这些要求:基于几何的奖励估计轨迹执行,但无法判断执行运动的视觉质量,而基于图像的奖励在不捕获动作执行或时间动态的情况下测量帧质量。我们假设视觉语言模型(VLM)提供了一个共享的推理空间,用于将动作与其视觉结果相关联。然而,根据完整的动作序列来判断完整的长视频会产生冗长、嘈杂的环境,其中短暂的局部动作证据可能会被错过或淡化。我们提出了 WorldReward,一种基于 VLM 的成对偏好奖励模型,它统一了相机条件世界模型的动作一致性和视觉质量评估。 WorldReward 将配对视频分解为与动作一致的块,将每个块组织为结构化视觉证据,并通过投票形成单独的视频级动作和视觉质量偏好来聚合块级决策。为了训练它,我们使用前沿 VLM 生成的结构化判断构建了一个大规模推理增强偏好数据集,并通过基于工具的代理审计和有针对性的人工审查进行了完善。我们进一步介绍了 WorldReward-Bench,这是一个人工注释的基准,用于衡量奖励模型在动作一致性、外观质量和运动质量方面与人类偏好的一致性。 WorldReward 在所有三个维度上均达到最高一致性,分别超过 GPT-5.5 3.42、1.45 和 3.56 个百分点。当用于 HY-WorldPlay 1.5 的 RL 后训练 时,它可以持续改善短期到长期的动作执行和视觉质量。