论文

SpaceEra++:视频中 3D 空间推理的统一框架

SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video

应用与实践视觉感知与空间理解

摘要

视觉空间理解被定义为从视觉输入推断对象关系和场景布局的能力,是机器人导航和实体交互等下游任务的基础。然而,预训练的视觉语言模型 (VLM) 仍然受到固有 2D 观察带来的空间不确定性以及 3D 空间理解数据稀缺的限制。为了解决这些限制,我们在 NeurIPS 2025 Spotlight 论文中提出了一种新颖的框架 SpaceEra。尽管它取得了显着的性能提升,但我们进一步观察到,其有效性受到扫描视频输入不足和推理约束薄弱的阻碍。为了应对这些新出现的挑战,我们将原始框架扩展为一个综合系统,称为SpaceEra++,涵盖数据构建、模型设计、训练优化和提示推理。具体来说,为了缓解输入不足,我们引入了 ScenePick,这是一种帧采样策略,可以平衡空间覆盖与对象语义,以生成紧凑而全面的场景表示。此外,为了增强空间推理,我们开发了 SpaceAlign,它通过联合利用绝对坐标和相对空间关系来强制成对对象约束,从而使优化与空间精度对齐。跨多个基准的广泛实验证明了相对于强基线的持续改进,而消融研究验证了每个组件的单独和联合贡献,进一步的分析为未来的研究提供了指导。