论文
FF3R:从无约束视图进行前馈特征 3D 重建
FF3R: Feedforward Feature 3D Reconstruction from Unconstrained views
摘要
视觉基础模型的最新进展彻底改变了几何重建和语义理解。然而,大多数现有方法孤立地处理这些功能,导致冗余管道和复合错误。本文介绍了 FF3R,这是一种完全无注释的前馈框架,它统一了无约束多视图图像序列的几何和语义推理。与之前的方法不同,FF3R 不需要相机姿态、深度图或语义标签,仅依赖于 RGB 和特征图的渲染监督,为统一 3D 推理建立了可扩展的范式。此外,我们通过两项关键创新解决了前馈特征重建管道中的两个关键挑战,即全局语义不一致和局部结构不一致:(i)标记明智的融合模块,通过交叉注意用语义上下文丰富几何标记,以及(ii)语义-几何互助机制,将几何引导的特征扭曲与语义感知体素化相结合以实现局部一致性。 ScanNet 和 DL3DV-10K 上的大量实验证明了 FF3R 在新颖视图合成、开放词汇语义分割和深度估计方面的卓越性能,以及对野外场景的强大泛化能力,为需要空间和语义理解的实体智能系统铺平了道路。