论文
FreeOcc:无需训练 体现的开放词汇占用预测
FreeOcc: Training-Free Embodied Open-Vocabulary Occupancy Prediction
摘要
现有的基于学习的占用预测方法依赖于大规模 3D 注释,并且在不同环境中的泛化能力很差。我们提出了 FreeOcc,一个 无需训练 框架,用于根据单目或 RGB-D 序列进行开放词汇占用预测。与之前需要体素级监督和 真值 相机姿势的方法不同,FreeOcc 无需 3D 注释、姿势 真值 或任何学习阶段即可运行。 FreeOcc 通过四层管道逐步构建全局一致的占用图:SLAM 主干估计姿态和稀疏几何;几何一致的高斯更新构造密集的 3D 高斯图;来自现成视觉语言模型的开放词汇语义与高斯原语相关联;概率高斯占用投影产生密集的体素占用。尽管完全是 无需训练 并且与姿势无关,但与之前的自监督方法相比,FreeOcc 在 EmbodiedOcc-ScanNet 上的 IoU 和 mIoU 实现了超过 2 倍的改进。我们进一步介绍了 ReplicaOcc,这是室内开放词汇占用预测的基准,并表明 FreeOcc 将零样本迁移到新环境,大大优于监督和自监督基线。项目页面:https://the-masses.github.io/freeocc-web/。