论文

探索室内语义占用预测的 2D 主干效应

Exploring 2D backbone effects for indoor semantic occupancy prediction

模型评测模型能力评测

摘要

语义占用预测为具体代理提供了体素级别的说明,其中空间是空闲的、已占用的以及语义上有意义的。在 EmbodiedScan 等 RGB-D 管道中,图像编码器通常保留为默认模块,尽管其特征是后来采样到 3D 网格中的视觉证据。我们直接研究这种设计选择。一个核心发现是,改变 2D 主干比几个精心设计的占用架构或模块更能提高占用精度。我们保持主 RGB-D 投影、深度分支和占用头固定,仅替换图像主干。比较的编码器是 CLIP-ResNet、CLIP-ViT、BLIP2 和 DINOv2。在受控设置下,测量的mIoU变化很大:DINOv2获得30.55%,BLIP2获得29.49%,CLIP-ViT获得24.33%,CLIP-ResNet获得17.41%。更强的编码器还超过了原始 EmbodiedScan ResNet-50 基线,而无需修改下游 3D 融合管道。类级别的结果给出了更详细的情况:DINOv2 在许多布局和结构类别上更强,而 BLIP2 在几个以对象为中心的类上仍然接近。 CLIP-ViT 明显优于 CLIP-ResNet,这表明 CLIP 特征作为密集标记的暴露方式对于体素提升很重要。这些结果表明,图像主干并不是体现语义占用中的次要工程细节,而是最终 3D 预测中变化的主要来源。