论文
学习检索:视频世界模型的记忆检索内化
Learning to Retrieve: Internalizing Memory Retrieval for Video World Models
摘要
视频世界模型旨在生成以摄像机轨迹为条件的可探索的、3D 一致的场景视频。现有方法通常依赖于显式检索先前观察到的内容的外部存储系统,以减轻长视野生成期间的场景漂移。然而,这些辅助记忆路径在模型的内部生成动力学之外运行,从而阻止模型本质上学习何时以及应该检索哪些历史信息。我们建议将记忆检索内化到生成过程中,使检索成为视频世界模型的内在行为,而不是依赖外部记忆系统。基于这个原则,我们引入了 \textbf{Learning-to-Retrieve (L2R)},它将模型的持久内部状态重新用作历史上下文的记忆。相机调节的检索门选择性地从此状态访问相关历史信息,确定 \textit{检索什么},而检索触发器确定 \textit{何时检索}。我们进一步监督触发器 3D 重新可见性信号,当先前观察到的内容重新进入当前视图时激活检索,同时保留现有上下文。这些组件共同使模型能够内在地获取记忆检索行为,并将相关的历史观察结果合并到生成中,而无需单独的检索路径。在多个基本模型和相机重访基准测试中,L2R 提高了长期场景一致性,同时消除了对外部内存组或 3D 条件的需求。https://jkhu29.github.io/l2r