论文

OneCanvas:通过全景重投影理解 3D 场景

OneCanvas: 3D Scene Understanding via Panoramic Reprojection

模型架构Transformer

摘要

视觉语言模型 (VLM) 中现有的 3D 场景理解方法要么依赖复杂的、特定于模型的几何编码器,要么依赖大量的训练预算来实现空间推理。相反,OneCanvas 将所有视图中的面片特征聚合到单个等矩形全景画布上。也就是说,每个补丁都使用其深度和相机姿势未投影到 3D 世界坐标,然后以从画布原点看到的该点的连续经度和纬度放置在画布上,在重叠视图之间没有光栅化或聚合。将补丁公制坐标的 3D 位置嵌入添加到其功能中,恢复将世界位置折叠为角度画布坐标时丢失的深度。因此,来自所有帧的补丁共享一个空间坐标系,无需融合或对主干进行重大架构修改。预训练的 VLM 会像普通图像一样使用该表示形式。由于画布可以以任何感兴趣的姿势为中心,因此相同的表示直接支持从特定角度进行情境推理,这是机器人技术和具体人工智能的常见要求。借助这种表示,我们还可以引入空间预训练课程:通过在空画布上选定的 3D 世界位置上按程序放置从真实图像中绘制的对象的补丁特征,我们生成跨越广泛空间推理任务的动态监督,并控制答案分布以减少空间推理捷径。 OneCanvas 在 SQA3D 和 VSI-Bench 上取得了最先进的结果,并推广到 SPBench 上的分布外数据,使用的训练计算量比基准性能最接近的竞争对手少一个数量级。