论文
PanoWorld:迈向 360$^\circ$ 全景世界的空间超感
PanoWorld: Towards Spatial Supersensing in 360$^\circ$ Panorama World
摘要
多模态大型实验室模型(MLLM)在占主导地位的透视图像范式下仍然难以理解空间理解,该范式继承了类人感知的狭窄视野。对于导航、机器人搜索和 3D 场景理解,360 度全景传感通过一次性捕获整个周围环境提供了一种超感知形式。然而,现有的 MLLM 管道通常将全景图分解为多个透视图,从而很大程度上隐含了等距柱状投影 (ERP) 的球形结构。在本文中,我们研究了全景理解,这需要 MLLM 将 ERP 全景推理为连续的、以观察者为中心的空间。为此,我们首先定义了全景原生理解的关键能力,包括语义锚定、球形定位、参考系变换和深度感知 3D 空间推理。然后,我们构建一个大规模的元数据构建管道,将混合源 ERP 全景图转换为几何感知、基于语言和深度感知的监督,并将这些信号实例化为能力对齐的指令调整数据。在模型方面,我们引入了具有球形空间交叉注意力的 PanoWorld,它将球形几何形状注入到视觉流中。我们进一步构建了 PanoSpace-Bench,一个用于评估 ERP 原生空间推理的诊断基准。实验表明,PanoWorld 在 PanoSpace-Bench、H* Bench 和 R2R-CE Val-Unseen 基准测试上的性能显着优于专有和开源基准。这些结果表明,强大的全景推理需要专门的全景本机监督和几何感知模型适应。所有源代码和建议数据将公开发布。