论文

WorldGuide:用于程序任务执行的目标导向视频世界模型

WorldGuide: Goal-Directed Video World Model for Procedural Task Execution

智能体系统上下文与知识模型评测记忆Agent 架构与控制循环基准与评测资源

摘要

视频生成器和基于视频的世界模型可以合成合理的视觉轨迹,但长期程序任务需要生成以适应实际生成的内容。模型必须根据其生成的状态确定下一个操作、执行该操作并识别任务何时完成。开环生成无法适应执行结果,而现有的闭环系统通常依赖于预训练的执行器或间接验证。这就在决定一项行动和成功实现它之间留下了差距。我们将程序视频生成表述为\emph{视觉世界空间中的闭环任务执行}并引入\textbf{WorldGuide}。仅给定初始图像和任务目标,WorldGuide 就会预测原子动作,生成其相应的视频剪辑,并使用生成的结果选择下一个动作或终止。 Planner 和 Executor 接受相同步骤级程序演示的训练:Planner 学习根据视觉进度预测下一个原子动作或任务完成情况,而 Executor 则直接接受训练 实现预测的行动。分层视觉记忆以有限的历史token成本在长期执行中维护状态。由于缺乏联合规划器-执行器训练的步骤级动作视频监督,我们引入了 \textbf{WorldGuide Bench}:跨 245 个任务和 27 个程序类别的大约 59K 个步骤注释视频。尽管 MiniMax-H3 接收了参考行动计划,WorldGuide 在 \textbf{WorldGuide-Bench} 上实现了 33.33\% 的任务成功率,而近期表现强劲的视频模型 MiniMax-H3 的任务成功率为 29.90\%,并且在仅目标条件下在 \textbf{VideoCraft-Bench} 上实现了 47.69\% 的任务成功率,而 MiniMax-H3 的任务成功率为 32.73\%。这些结果证明了将规划与学习执行相结合对于目标导向的程序视频生成的重要性。