论文
世界中的世界:用世界模型探索世界
World in World: Explore the World with World Models
摘要
自回归视频世界模型可以实现交互式、长视野的探索,但灵活的控制仍然具有挑战性。从新的视点探索源视频需要生成的卷展栏与记录的事件保持同步,将观察到的内容放置在请求的视图中,合理地完成新暴露的区域,并在重新访问时恢复先前生成的外观。现有方法通常通过特定于任务的模块或额外训练来满足这些要求。我们提出了 World in World,一个 无需训练 推理时间接口,它将异构控制证据转换为摄像机和时间标记的干净视觉状态,这些状态通过冻结因果视频模型的本机自注意力来读取。证据包括源视频观察、目标视图场景投影、指导完成新暴露的主题区域的几何渲染,以及检索超出滚动缓存的生成状态。每个证据源都带有 词元级 支持和自己的可用性时间表。对应路由器将持久点标识与几何结构相结合以建立词元对应关系,引导支持的查询匹配源视频词元。然后,循证注意力 CFG (EWA) 使用来自同一去噪前向传递的注意力响应独立调节每个辅助通道的额外贡献。共享接口支持摄像机控制的重新渲染、长视距重访以及具有相同冻结骨干的人体运动传输。我们在不同视点变化下通过摄像机控制的视频重新渲染来评估 World in World,评估感知质量、时间一致性和摄像机跟随准确性。