论文

RegVGGT:通过调节内存进行流媒体的可持续视觉几何基础

RegVGGT: Sustainable Visual Geometry Grounding for Streaming via Regulated Memory

模型推理KV Cache

摘要

从长视频流输入进行 3D 重建给前馈重建模型 (FFRM) 带来了一个困境,即在有限的 GPU 下无法保留全流推理上下文。此 http URL 研究试图通过推理上下文完整性和 GPU 内存使用之间的权衡来解决此问题,这要么会遭受快速内存膨胀,要么会由于人为限制内存而降低上下文完整性。此 http URL 通过我们的关键观察发现,词元的初始显着性可靠地决定了其长期重要性在整个流中,我们提出了 RegVGGT,一种免训练的词元调节方法,它积极地调节传入此 http URL 的词元,每帧最多允许 1% 的词元来更新上下文内存,我们的方法极大地抑制了内存膨胀,因为流此 http URL 具有与 FlashAttention 兼容的词元显着性估计方案,RegVGGT 能够在消费级 GPU 上处理数千个帧,而对重建此 http URL 的影响可以忽略不计。实验表明,RegVGGT 实现了最先进的技术在不同 FFRM 预测任务中的长视野基准上的性能,大大超过了之前基于 FFRM 的流重建基线。