论文

CityRAG:通过空间视频生成走进城市

CityRAG: Stepping Into a City via Spatially-Grounded Video Generation

应用与实践内容创作

摘要

我们解决了生成基于空间的 3D 一致、可导航环境的问题:模拟真实位置。现有的视频生成模型可以生成与文本 (T2V) 或图像 (I2V) 提示一致的合理序列。然而,在任意天气条件和动态对象配置下重建现实世界的能力对于自动驾驶和机器人模拟等下游应用至关重要。为此,我们提出了 CityRAG,这是一种视频生成模型,它利用大量地理注册数据作为物理场景地面生成的上下文,同时保持复杂运动和外观变化的学习先验。 CityRAG 依赖于时间上未对齐的训练数据,该数据教导模型在语义上将底层场景与其瞬态属性分开。我们的实验表明,CityRAG 可以生成连贯的长达数分钟的与真实空间对应的视频序列,维持数千帧的天气和照明条件,实现闭环,并导航复杂的轨迹以重建现实世界的地理。