论文

卷 Transformer:重温 Vanilla Transformer 以实现 3D 场景理解

Volume Transformer: Revisiting Vanilla Transformers for 3D Scene Understanding

模型架构Transformer

摘要

Transformer 已成为深度学习的共同基础,但 3D 场景理解仍然依赖于具有强大领域先验的专业主干。这将该领域与更广泛的 Transformer 生态系统隔离开来,限制了其他领域研究进展的转移以及日益优化的软件和硬件堆栈的好处。为了弥补这一差距,我们提出了 Volume Transformer (Volt),它只需最少的修改即可将普通 Transformer 编码器适应 3D 场景。具体来说,Volt 将 3D 场景划分为体积补丁标记,通过完整的全局自注意力处理它们,并通过 3D 旋转位置嵌入 (RoPE) 注入位置信息。我们的初步实验表明,在标准 3D 基准上简单地训练 Volt 会导致泛化能力较差,凸显了当前 3D 监督规模的有限。为了克服这个问题,我们引入了一种基于强大的 3D 增强、正则化和卷积老师的 蒸馏 的数据高效训练方法,使 Volt 能够与最先进的方法竞争。然后,我们通过对多个数据集的联合训练来扩展监督,并表明与特定领域的 3D 主干相比,Volt 从扩大规模中获益更多,在多个室内和室外语义分割基准上取得了最先进的结果。最后,作为标准 3D 实例分割管道中的嵌入式骨干网,Volt 还设定了新的技术水平,突出了其作为 3D 场景理解的简单、可扩展和通用骨干网的潜力。