论文

Q-GeoMem:用于视频空间推理的问题引导几何记忆

Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning

摘要

视频空间推理需要随着时间的推移积累视点相关的证据,同时保留对所提出的问题有用的信息。现有的空间视频语言模型改进了几何感知和远程上下文建模,但通常将内存视为通用的时间缓存,这可能会引入冗余或不相关的证据并削弱长期推理。我们提出了 Q-GeoMem,一种用于视频空间推理的问题引导几何记忆框架。 Q-GeoMem 将相机调节的几何形状注入视觉标记中,并维护两个互补的记忆:用于最近密集特征和相机状态的细粒度上下文库,以及用于紧凑远程证据的语义几何证据库。对于每个候选框架,经过校准的 Q-Former 会估计问题相关性,同时根据活动证据库重新计算新颖性和证据效用。由此产生的相关性新颖性实用程序控制基于容量的替换,并在记忆读取过程中充当注意偏差。在推理过程中,两个存储器在更新之前都会被读取,并与当前帧表示自适应地融合。跨越两个域内和五个分布外基准的广泛实验以及受控内存分析表明,Q-GeoMem 在评估的设置中实现了最先进的性能,并验证了问题引导的几何证据选择的有效性。