驱逐即估计:测试时记忆的固定滞后平滑视角,以及测量何时胜过累积
Eviction as Estimation: A Fixed-Lag Smoothing View of Test-Time Memory, and When Measuring Beats Accumulating
摘要
具有有界工作记忆的语言模型必须反复决定保留哪些已存储条目。现有的每种已部署方法都在条目到达的瞬间做出决定,依据来自过去(StreamingLLM、H2O)或来自对未来的猜测(SnapKV)。我们将这一选择重构为对一个隐藏信号——某条目是否会被重用——的估计问题,并把现有方法放到一条轴上,即提交滞后$H$:在线滤波器和学习型预测器在$H=0$处提交,而Belady的离线最优则位于整个未来都已知的极端。中间缺失的区域——固定滞后平滑——等待有界数量的步数,观察一次正确的近期预测注意到了哪些条目,然后才提交。这种测量,即已演示效用,将Belady不可观测的未来请求转化为可以从模型自身读出的量。我们将其实例化为一个免训练策略RMM,它是H2O的严格泛化,当测量均匀时恰好退化为H2O。在重用为内生且在时间上分离的受控场景中,已演示效用远比累积注意力更能识别被使用的记忆,小的有界记忆表现得如同大得多的记忆。但在独立的第三方基准上——在NVIDIA的KVPress框架中对其自带的SnapKV、H2O与StreamingLLM实现运行——这一优势基本消失:在单轮问答上RMM与H2O持平,在流式多轮场景下则输给H2O和SnapKV。原因很简单:在自然文本上模型对大多数token的判断是正确的,因此按正确性加权注意力几乎不改变什么,除非重用尖锐且内生(标准基准并不演练这种情形),已演示效用会塌缩为累积注意力。我们的贡献是这一框架以及一幅关于测量何时胜过累积的诚实地图,而非新的最优纪录。