论文
LOCI:用于流世界模型的空间线性存储器
LOCI: Spatial Linear Memory for Streaming World Models
摘要
当摄像机重新访问之前观察到的区域时,视频世界模型应该重现之前的情况。这既需要记住过去的观察结果,又需要为当前的观点检索正确的观察结果。键值缓存保留视觉细节,但随着视频长度而增长;循环记忆很紧凑,但将历史压缩为固定大小的状态,因此不再可以直接访问单个过去的观察结果。我们引入了 LOCI,一种保留两种表示的混合空间记忆架构。在一半的转换器块中,主要注意力保留了过去观察的键值缓存;在另一半中,它仅限于当前块,并由循环线性注意存储器补充,其读取和写入以投影相机几何为条件,因此视点同时输入存储器寻址和存储的内容。循环读出流入后续的缓存支持块,并为它们的查询提供累积的场景上下文。在公共 MIND 内存基准和留出集的记录轨迹上,LOCI 比代表性世界模型和相同配方的全 softmax 模型更忠实地再现了重新访问的内容;有了完整的历史记录,相对于完整的 softmax,它在相同长度下将峰值内存降低了约 30%。凭借有限的保留观察值,它可以以恒定的内存传输长视频,并且在相同预算下比完整的 softmax 更忠实。