论文
视频生成器是否跨段追踪世界?视频连续性世界状态推理的基准和方法
Do Video Generators Track the World Across Segments? A Benchmark and Method for World-State Reasoning in Video Continuation
摘要
视频生成器通过组合较短的部分来构建长视频,可以通过逐个生成片段或通过自回归扩展块来构建。每个新部分通常取决于历史观察的记忆,例如最近的帧、选定的关键帧、记忆库或缓存的特征。这些记忆保留了过去的可见证据,但当前的生成器无法可靠地将这些证据转化为世界状态界面:在先前的操作之后视频世界中保存了什么以及在下一个提示下它应该如何变化。过去的帧仍然有效的历史记录,但它可能无法描述下一段所需的状态;有些状态必须从遮挡或隐式变化中推断出来,而不是从直接观察到的帧中复制。这为视频延续创建了一个简单但被忽视的问题:给定先前的视频、其提示和新提示,模型能否生成反映由历史视频和新提示确定的状态的延续?为了回答这个问题,我们引入了 Statebench,这是一个通过测试三个状态类别(过去可见状态、闭塞进程状态和复杂转换状态)的连续性来解决这一差距的基准测试。我们进一步提出 Stateagent,它显式维护实体状态表示,在新提示下更新它,将预测的动作后状态作为未来的结束帧,并渲染下一个视频。实验表明,我们的方法通过将所有情况状态得分 (SCS-All) 从 45.2 提高到 69.3,改善了受控视频连续性,并且也有利于一分钟规模的故事生成。代码可在 https://github.com/AMAP-ML/StateAgent 获取。