论文

ConsiSpace:学习几何一致性对于视频空间推理很重要

ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning

模型训练强化学习

摘要

视频空间推理对于面向导航的感知和长视频问答至关重要,其中模型必须在不断变化的视点下推断出跨长视野的空间关系。然而,现有的多模态 大语言模型 (MLLM) 很大程度上仍然以语义为中心,并且通常无法从冗余视频观察中可靠地聚合一致的空间证据,导致推理效率低下或不稳定。为了解决这些问题,我们提出了 ConsiSpace,这是一种用于几何敏感视频空间推理的几何一致性感知框架,它将空间一致性转化为证据组织原则和明确的后 SFT 学习信号。我们构建了一个几何一致的记忆(GCM),包括隐式证据标记和显式几何线索,并利用有效的组织策略来紧凑地保存与任务相关的空间证据。此外,我们在监督 微调 后利用统一一致性自监督强化学习(UC-SSRL)来提高跨视图稳定性,并提供答案、度量和拓扑一致性奖励。对三个空间推理基准(VSI-Bench、OSI-Bench 和 MMSI-Video-Bench)的广泛实验显示出一致的收益,平均得分比最强基准提高了 12.6 分。