论文
KV-Rescue:以分步交错恢复推理语言模型的KV逐出损失
KV-Rescue: Recovering Reasoning Language Model KV Eviction Loss via Stepwise Interleaving
摘要
KV缓存逐出限制了长推理轨迹的内存成本,但本质上是有损的,因为模型是在其历史的部分视图上进行解码。在激进预算下,这不仅降低准确率,还可能导致失控退化,即模型生成不连贯或重复的token直至达到长度上限。我们把这类损失的主要部分刻画为缺失上下文导致的信息缺口,而非模型容量受限导致的能力缺口。一个被逐出的7B模型与一个全上下文的1.5B模型会产生互补的错误,在二者答案之间做先知选择可挽回与全KV 7B模型准确率差距的79%。基于这一观察,我们提出KV-Rescue,一个免训练的推理框架,用一个轻量级全上下文辅助模型来弥合KV逐出引入的信息缺口。KV-Rescue把两个模型的推理步骤交错到一条共享轨迹中。在线检测器利用熵与可压缩性提前终止基础模型不连贯或重复的候选生成。在Qwen2.5-Math 7B与72B上的五个数学基准中,KV-Rescue在逐出预算B=64下平均挽回了因逐出而损失准确率的87%。解码成本分析进一步显示,阻止失控退化使基础模型的token生成平均减少43%。
