论文
HiSpatial:驯服视觉语言模型中的分层 3D 空间理解
HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
摘要
要实现视觉语言模型 (VLM) 的类人空间智能,需要从 2D 观察中推断 3D 结构,识别 3D 空间中的对象属性和关系,并执行高级空间推理。在本文中,我们提出了一个原则性的层次框架,它将 VLM 中 3D 空间理解的学习分解为四个逐渐复杂的级别,从几何感知到抽象空间推理。在此框架的指导下,我们构建了一个自动化管道,可处理大约 500 万张图像和超过 4500 万个对象,为 VLM 监督的 微调 生成跨不同任务和场景的 3D 空间 VQA 对。我们还开发了 RGB-D VLM,将公制尺度点图作为辅助输入,以进一步增强空间理解。大量的实验表明,我们的方法在多个空间理解和推理基准上实现了最先进的性能,超越了专门的空间模型和大型专有系统,例如 Gemini-2.5-pro 和 GPT-5。此外,我们的分析揭示了分层任务级别之间明显的依赖关系,为多级别任务设计如何促进 3D 空间智能的出现提供了新的见解。