论文

连接 3D 高斯和语义占用,从未展示的图像中实现全面的开放词汇场景理解

Bridging 3D Gaussians and Semantic Occupancy for Comprehensive Open-Vocabulary Scene Understanding from Unposed Images

应用与实践视觉感知与空间理解

摘要

从稀疏的、未摆出的图像中进行全面的 3D 场景理解需要一个模型来恢复可渲染的几何形状、开放词汇语义以及空闲/占用的 3D 空间,而无需依赖外部相机校准。最近的前馈高斯方法改进了无姿态重建和语义渲染,但它们的高斯基元主要通过图像空间目标进行优化,并且在未观察区域中仍然受到弱约束。我们提出了 \textit{COVScene},一种无姿势语义高斯框架,它通过可微分体积提升将可渲染高斯图元与密集语义占用场耦合起来。 COVScene 不是仅在评估时将高斯函数转换为体素,而是在训练计算图中提升了预测的语义高斯函数,因此体积正则化为高斯不透明度、几何形状和语义特征提供了梯度。该框架结合了语义感知几何 Transformer、多任务高斯解码、几何基础 蒸馏 和占用熵正则化,以支持单一表示中的新颖视图合成、开放词汇语义查询和语义占用预测。 ScanNet 和 ScanNet++ 上的实验表明,COVScene 保持了有竞争力的渲染质量,改进了开放词汇分割,并且比没有直接体素级监督的自监督基线实现了更强的语义占用预测。