论文

视频模型可以通过可验证的奖励进行推理

Video Models Can Reason with Verifiable Rewards

模型训练强化学习

摘要

视频扩散模型在感知真实性和时间一致性方面取得了快速进展,但它们仍然主要针对合理的生成而不是可验证的推理进行优化。这种限制在生成的视频必须满足明确的空间、时间或逻辑约束的任务中尤其明显。受到可验证奖励强化学习 (RLVR) 在面向推理的语言模型中的作用的启发,我们推出了 VideoRLVR,这是一种利用基于规则的反馈来优化视频扩散模型的实用方法。 VideoRLVR 将视频推理制定为可验证视觉轨迹的生成,并由 SDE-GRPO 优化主干、密集分解奖励和用于高效训练的 Early-Step Focus 策略组成。 Early-Step Focus 策略将策略优化限制在早期去噪阶段,在保持性能的同时将训练延迟减少约 40%。我们在 Maze、FlowFree 和 Sokoban 这三个具有客观成功标准的程序生成领域上评估了 VideoRLVR。在这些任务中,VideoRLVR 持续改进了受监督的 微调 基线,事实证明,密集的分解奖励在低成功率环境中尤其重要。我们的强化学习优化模型在这些可验证的推理基准和域外基准上也优于经过评估的专有和开源视频生成模型。这些结果表明,可验证的强化学习可以使视频模型超越感知模仿,转向更可靠的规则一致的视觉推理。