论文
VASC:具有跨层内存的值感知稀疏注意力,可实现高效 3D 重建
VASC: Value-Aware Sparse Attention with Cross-Layer Memory for Efficient 3D Reconstruction
摘要
VGGT 等前馈 3D 视觉模型取得了显着的进步,在一次传递中统一了相机估计和密集场景重建。然而,它们的二次全局注意力使得长图像序列变得昂贵,而现有的稀疏方法可能有利于高度关注但价值冗余的区域。为了解决这些限制,我们引入了 VASC,一种无需训练的稀疏注意力方法,结合了值感知块选择和执行感知跨层内存。我们的值感知块选择集成了池化查询—键相关性与相邻值对比,减少了冗余,同时保留了查询相关和独特的内容。跨层内存跨层跟踪未服务的需求,并根据实际执行更新此状态,使以前服务不足的块能够在固定的计算预算下竞争。使用 VGGT 和 $π^3$ 在 7Scenes 和 NeuralRGB-D 上进行的实验表明,与 FasterVGGT 相比,姿态估计和重建质量有所提高,并且推理速度比稠密VGGT 快达 $2.29\times$。代码可在 https://github.com/kosakayamahoo-design/VASC. 获取