论文
Spark3R:以非对称词元压缩加速前馈三维重建
Spark3R: Asymmetric Token Reduction Makes Fast Feed-Forward 3D Reconstruction
摘要
基于 Vision Transformer 的前馈 3D 重建模型可以直接从一小组输入图像中估计场景几何形状和相机姿势,但由于全局注意力层的二次成本,将它们缩放到具有数百或数千帧的视频输入仍然具有挑战性。最近的词元合并方法通过压缩全局注意力层内的词元序列来加速这些模型,但它们对查询词元和键值词元应用统一的减少,忽略了它们在 3D 重建中功能上不同的作用。在这项工作中,我们确定了前馈 3D 重建模型的一个关键属性:查询标记对特定于视图的几何请求进行编码并对压缩敏感,而键值标记表示共享场景上下文并容忍激进的压缩。在这一见解的指导下,我们提出了 Spark3R,这是一个 无需训练 加速框架,它通过分配不同的缩减因子来解耦查询词元和键值词元的压缩,并将组内词元合并应用于查询词元,并将轻量级词元修剪应用于键值词元。此外,Spark3R 自适应地调整跨层的键值缩减因子,进一步改善质量效率权衡。作为无需重新训练的即插即用框架,Spark3R 直接集成到多个预训练的前馈 3D 重建模型中,包括 VGGT、$π^3$、Depth-Anything-3 和 VGGT-$Ω$,并在 1,000 帧输入上实现高达 $28\times$ 的加速,同时保持有竞争力的重建质量。