论文
GeoAnchor:通过潜在分解进行协作推理以实现 3D 空间理解
GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding
摘要
尽管多模态 大语言模型 (MLLM) 取得了显着的进展,但从 2D 图像理解 3D 空间关系仍然是一个严峻的挑战。现有方法主要依赖于符号文本标记,其本质上缺乏表示连续几何信息的保真度。虽然最近的方法使用潜在表示来增强推理,但依赖单一潜在类型无法适应空间任务的多样性,导致复杂几何场景中的错位。为了解决这些限制,我们提出了 GeoAnchor,一种交错的文本潜在推理框架。 GeoAnchor 将 3D 空间信息分解为三个互补的组件:物体定位的位置潜在、关系方向的方向潜在和场景结构的几何潜在。这些组件在结构化空间中重新组合,以构建本地证据,同时捕获全局上下文,从而实现动态和可解释的推理。此外,我们引入了一种协作训练策略,指导模型从局部空间感知到全面的 3D 理解。对各种复杂的 3D 推理任务进行的大量实验表明,GeoAnchor 的性能优于现有技术,验证了其有效性和泛化能力。