论文

LLM 条件结构化室内预测的粗语义注入

Coarse Semantic Injection for LLM-Conditioned Structured Indoor Prediction

应用与实践视觉感知与空间理解

摘要

大语言模型 (LLM) 最近被用作结构化解码器,用于从 3D 点词元输入进行室内理解。然而,点云编码器通常在体素化和稀疏池化后不能充分表示薄的结构元素,例如门窗,并且可能会错过杂乱场景中的单个家具实例。我们为 LLM 条件结构化解码提出了一种保留接口的语义增强。关键思想是将语义证据与点云表示关联起来,将其简化为粗略的四组代码(家具、墙壁、开口等),并将其编码为 RGBB 点接口:红色表示家具,绿色表示墙壁,蓝色表示开口,黑色表示其他,其中 RGBB 表示用三个 RGB 通道而不是额外的第四个通道表示的四种语义颜色状态。该语义颜色代码在标记化之前附加到原始原始点属性中,因此几何和语义共享相同的稀疏标记化路径,而下游语言模型解码器和输出序列化保持不变。我们进一步引入了一个轻量级路由语义转移模块,其辅助头仅用于训练时间比/预算正则化和分析,以加强稀疏池化后的语义线索。整个管道可以使用 RGB 派生的语义证据。在这些受控的语义源设置下,报告的指标在 Structured3D、SpatialLM 数据集和 ARKitScenes 中得到改进,特别是在杂乱场景中打开本地化和每个实例的家具检测。消融阐明了语义源、颜色编码、标记融合和移位注入的作用,同时也表明颜色/熵效应仍然很重要。