论文

LongSpace:探索视频中从感知到回忆的长视空间记忆

LongSpace: Exploring Long-Horizon Spatial Memory from Perception to Recall in Video

摘要

多模态 大语言模型 (MLLM) 具有先进的图像和视频理解能力,并且可以越来越多地处理更长的视觉输入。自动驾驶和机器人导航等长视野任务需要的不仅仅是识别当前视图,因为模型必须记住并检索之前观察到的空间布局、路线、视点变化和对象状态。为了评估这种能力,我们引入了 LongSpace-Bench,这是一种用于长视野空间记忆的房间游览视频基准,涵盖场景感知、空间关系和空间记忆。在这项工作中,我们进一步提出了LongSpace,一种用于长视频空间推理的记忆框架。 LongSpace 将长视频建模为连续块,将 3D 结构线索合并到早期解码器层中,并构建用于问题引导检索的层感知内存。多个空间推理基准的实验表明,LongSpace 提高了长视频空间理解,进一步证明显式空间记忆是长视距视频 MLLM 的关键功能。