论文
视频世界模型的几何感知隐式记忆
Geometry-Aware Implicit Memory for Video World Models
摘要
视频世界模型旨在模拟可控的视觉环境,但长期执行轨迹取决于观察离开其本机上下文窗口后模型记住的内容。显式记忆保留帧或在线 3D 重建,这可能会遭受启发式检索错误、冗余外观存储或重建伪影的影响。隐式存储器将历史压缩为紧凑状态,但现有设计并未明确限制对跨视图场景几何进行编码。我们提出了 GIM-World,一种用于视频世界模型的几何感知隐式记忆框架。轻量级 Transformer 编码器将可变长度历史记录压缩为固定大小的内存词元,相机可查询的几何头在训练期间将 3D 场景结构从冻结的基础模型提取到内存中,信息引导的修剪规则随着历史记录的增长保持编码成本有限。几何老师在推理时被丢弃,留下一个轻量级的内存模块。 MIND 上的实验表明,与显性记忆基线和隐性记忆基线相比,GIM-World 更好地保持了长期几何和视觉一致性。