论文
Attention 本身可以 Retrieve.RetrieveVGGT:无需训练 通过查询键相似性检索进行长上下文流式 3D 重建
Attention Itself Could Retrieve.RetrieveVGGT: Training-Free Long Context Streaming 3D Reconstruction via Query-Key Similarity Retrieval
摘要
Visual Geometry Grounded Transformer (VGGT) 通过可扩展的 Transformer 架构推进了 3D 重建,但全局注意力的二次复杂性阻碍了长上下文应用。 StreamVGGT 支持具有因果注意力的流式传输,但其 KV 缓存随帧线性增长,导致内存溢出和质量下降。我们提出了 RetrieveVGGT,一个 无需训练 框架,它将 VGGT 的上下文构建制定为检索问题。通过在每一步检索固定数量的相关帧,VGGT 保持可控的内存预算,该预算接近其训练上下文长度。有趣的是,我们发现 VGGT 第一个全局注意力层的当前帧查询和缓存的历史帧键之间的相似性已经是一个很强的相关性指标,消除了额外学习评分的需要。为了增强类似于推荐系统的信息多样性,我们提出了分段采样,以便检索跨越不同的相关分段,而不是单个高相似性区域。我们设计了一种姿势感知空间记忆机制,根据已经估计的相机姿势来组织历史帧,从而实现位置感知检索。大量实验表明,RetrieveVGGT 实现了最先进的性能,优于 StreamVGGT、TTT3R 和 InfiniteVGGT,同时无论序列长度如何,都能保持恒定的内存使用量。代码可在 https://github.com/zzctmd/RetrieveVGGT 获取。