论文

Fus3D:从前馈几何 Transformer 潜伏解码合并的 3D 几何

Fus3D: Decoding Consolidated 3D Geometry from Feed-forward Geometry Transformer Latents

应用与实践视觉感知与空间理解

摘要

我们提出了一种前馈方法,可以在不到三秒的时间内从非结构化图像集合中进行密集符号距离场(SDF)回归,无需相机校准或事后融合。我们的主要见解是,预训练的多视图前馈几何 Transformer 的中间特征空间已经编码了强大的联合世界表示;然而,现有的管道丢弃了它,在事后组装 3D 几何之前通过每个视图的预测头路由特征,这丢弃了有价值的完整性信息并积累了不准确性。相反,我们通过学习体积提取直接从几何 Transformer 特征中执行 3D 提取:体素化规范嵌入通过交错的交叉和自注意力逐渐吸收多视图几何信息到结构化体积潜在网格中。然后,一个简单的卷积解码器将该网格映射到密集的 SDF。我们还提出了一种可扩展的、有效性感知的监督方案,直接使用从深度图或 3D 资产派生的 SDF,解决非防水网格等实际问题。我们的方法在稀疏和密集视图设置中产生完整且定义明确的距离值,并演示了几何上合理的完成。代码和更多材料可以在 https://lorafi.github.io/fus3d 找到。