论文
StreamCacheVGGT:具有鲁棒评分和混合缓存压缩的流式视觉几何 Transformer
StreamCacheVGGT: Streaming Visual Geometry Transformers with Robust Scoring and Hybrid Cache Compression
摘要
从连续视频流重建密集的 3D 几何需要在恒定的内存预算下进行稳定的推理。现有的 $O(1)$ 框架主要依赖于“纯逐出”范式,该范式由于二进制词元删除和局部单层评分的评估噪声而遭受重大信息破坏。为了解决这些瓶颈,我们提出了 StreamCacheVGGT,这是一个 无需训练 框架,它通过两个协同模块重新构想缓存管理:跨层一致性增强评分 (CLCES) 和混合缓存压缩 (HCC)。 CLCES 通过跟踪 Transformer 层次结构中的标记重要性轨迹、采用顺序统计分析来识别持续的几何显着性来减轻激活噪声。利用这些强大的分数,HCC 通过引入三层分类策略超越了简单的逐出,该策略通过键向量流形上的最近邻分配将中等重要的标记合并到保留的锚中。这种方法保留了否则会丢失的基本几何背景。对五个基准(7-Scenes、NRGBD、ETH3D、Bonn 和 KITTI)的广泛评估表明,StreamCacheVGGT 树立了新的最先进水平,在严格遵守恒定成本约束的同时提供卓越的重建精度和长期稳定性。