论文

SSR3D-LLM:通过潜在步骤进行结构化空间推理,以实现统一 3D-LLM 中的细粒度定位

SSR3D-LLM: Structured Spatial Reasoning via Latent Steps for Fine-Grained Grounding in Unified 3D-LLMs

模型推理推理策略与问题分解

摘要

3D 对象定位根据自然语言定位 3D 场景中的参考对象。以实例为中心的统一 3D-LLM 旨在解决对话、QA 和字幕的基础问题,但许多依赖于将关系指令压缩为一个选择的单个指针式基础决策。这对于细粒度查询来说很脆弱,因为必须通过上下文对象和空间关系排除多个同类候选者。我们提出了结构化空间推理 3D-LLM (SSR3D-LLM),这是统一 3D-LLM 的结构化定位接口。给定固定的 Mask3D 对象建议,LLM 从查询中写入一系列潜在空间推理步骤和内存标记,并且几何感知评分器读取这些潜在步骤,以便通过步长掩码逐步细化候选排名。潜在步骤是在训练期间从标准基准目标监督和辅助参考线索监督中学习的,而推理仅使用输入查询和 Mask3D 建议。在 ReferIt3D、ScanRefer 和 Multi3DRef 中,SSR3D-LLM 在统一 3D-LLM 基线中取得了最强的结果,在细粒度基础上比单指针 QPG 基线有了显着的提升,并且比之前的统一 3D-LLM 有了一致的改进,同时保留了默认的语言任务路径。