论文

用于统一 3D 场景理解的 RGB 点图预训练

RGB-Pointmap Pretraining for Unified 3D Scene Understanding

模型训练预训练

摘要

通过与对比语言图像 预训练 (CLIP) 对齐来预训练 3D 编码器已成为学习 3D 场景理解的通用表示的一个有前途的方向。在本文中,我们提出了 UniScene3D,这是一个基于 Transformer 的框架,它通过利用预训练的 2D 基础模型的先验,从多视图 RGB 点图输入中学习统一的 3D 场景表示。为了实现鲁棒的 RGB 点图表示学习,我们引入了跨视图几何对齐和基础视图对齐,以强制跨视图的几何和语义一致性。广泛的低镜头和特定任务 微调 在视点基础、场景检索、场景分类和 3D 视觉问答方面展示了最先进的性能。这些结果将 UniScene3D 确立为统一 3D 场景理解的有效框架。项目页面:https://yebulabula.github.io/UniScene3D/