论文

Déjà View:循环 Transformer 用于多视图 3D 重建

Déjà View: Looping Transformers for Multi-View 3D Reconstruction

模型架构递归架构

摘要

最近的前馈 3D 重建 Transformer 已扩展到超过 10 亿个参数,遵循了计算机视觉中模型容量不断增加的更广泛趋势。然而,新出现的证据表明,连续的 Transformer 层的行为通常类似于类似操作的重复应用,并且多视图重建 Transformer 在解码器深度上逐步完善其预测。我们假设模型深度部分购买了迭代,在独特的参数中效率低下,而是在架构中使迭代变得明确。我们的模型 DéjàView 将单个循环的 Transformer 块循环应用于每个视图的特征,以进行 K 个细化步骤。经过一次训练,它将 K 作为推理时间计算旋钮,在涵盖室内、室外、以对象为中心和驾驶场景的五个重建基准中匹配或优于更大的前馈基线,同时使用其参数的一小部分和可比较或较低的计算。重要的是,在匹配的训练数据和计算下,相同的循环块公式优于具有独立每步参数的其他相同变体,这表明显式迭代不仅是容量的计算效率替代品,而且是多视图 3D 重建的更强的归纳偏差。