论文
当隐藏状态漂移时:KV 缓存能否拯救远程 推测解码?
When Hidden States Drift: Can KV Caches Rescue Long-Range Speculative Decoding?
摘要
推测解码 加速了 LLM 推理,但基于 SOTA 隐藏状态的绘图器会遭受远程衰减:随着推测步骤的增加,绘图精度会降低。现有的工作将这种衰减归因于训练推理不匹配,并提出测试时训练 (TTT) 作为补救措施,但我们观察到,即使在经过 TTT 训练的绘图员中,远程衰减仍然存在。我们从上下文信息保存的角度重新审视远程衰减。在隐藏状态重用中,我们认为目标隐藏状态充当有偏差的上下文压缩:它根据当前位置的注意力查询聚合历史标记信息,产生针对立即下一个标记预测而优化的紧凑表示。这种压缩可以抑制与当前查询不太相关但对后续推测步骤很重要的信息。相反,目标模型的 KV 缓存充当显式上下文,保留完整的 token-wise KV 表示集。因此,我们提出了 KV 重用假设:允许草图模型重用目标 KV 缓存可以为长期草图提供更丰富的信号。为了测试这个假设,我们引入了 KVShot,一个诊断框架,它比较了三种重用范例:仅隐藏、仅 KV 和混合。对 Qwen3-8B 的广泛评估表明,KV-Reuse 提高了远程接受度,尽管在当前训练流程下端到端加速仍然很小。我们的分析确定了两个关键的结构瓶颈:浅绘图者难以准确估计目标查询,以及绘图侧 KV 投影接收稀疏梯度信号。这些发现表明,要充分发挥 KV 感知解码的潜力,需要超越 TTT,转向分块训练范例。通过暴露这些瓶颈,KVShot 为设计下一代推理架构提供了基础诊断测试平台和清晰的路线图。