论文

Wan-R1:视频推理的可验证强化学习

Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning

模型训练强化学习

摘要

视频生成模型可以生成视觉上连贯的内容,但难以完成需要空间推理和多步骤规划的任务。强化学习(RL)提供了一条提高泛化能力的途径,但其在视频推理中的有效性取决于奖励设计——这一挑战还没有得到系统研究。我们通过将组相对策略优化(GRPO)应用于基于流的视频模型并训练它们进行迷宫求解和机器人导航任务来研究这个问题。我们首先表明,多模式奖励模型在这种情况下会发生灾难性的失败。为了解决这个问题,我们设计了基于客观任务指标的可验证奖励函数。对于结构化游戏环境,我们引入了多成分轨迹奖励。对于机器人导航,我们提出了嵌入级可验证奖励。我们的实验表明,具有可验证奖励的 RL 微调 可以提高泛化能力。例如,在复杂的 3D 迷宫上,我们的模型将精确匹配精度比 SFT 基线提高了 29.1%,在陷阱避免任务上提高了 51.4%。我们的系统奖励分析表明,可验证的奖励对于稳定的训练至关重要,而多模式奖励模型可能会导致退化的解决方案。这些发现将可验证的奖励设计确立为稳健视频推理的关键推动因素。代码将公开。