论文
ReasonAlloc:面向推理模型的分层解码时KV缓存预算分配
ReasonAlloc: Hierarchical Decoding-Time KV Cache Budget Allocation for Reasoning Models
摘要
由于键值 (KV) 缓存的快速增长,大型语言模型 (LLM) 推理中的长思维链 (CoT) 轨迹会导致严重的推理瓶颈。当前的解码时压缩方法通过令牌驱逐来缓解这个问题,但通常假设所有层和头之间的预算分布是统一的。相比之下,现有的非均匀预算分配方法主要是为静态提示预填充阶段设计的,它们没有捕获自回归推理的逐步上下文需求。为了弥补这一差距,我们提出了 ReasonAlloc,这是一个免训练框架,它将解码时 KV 压缩重新定义为分层预算分配问题。 ReasonAlloc 在两个互补的层面上运行:离线分层预分配策略捕获架构驱动的需求模式,我们称之为“\textit{Reasoning Wave}”,而在线 head-wise 策略在解码过程中根据实时效用将资源重新分配给信息丰富的 head。使用 DeepSeek-R1-Distill-Llama-8B、DeepSeek-R1-Distill-Qwen-14B 和 AceReason-14B 对数学推理基准(MATH-500、AIME~2024)进行的评估表明,ReasonAlloc 的性能优于统一预算 R-KV、SnapKV 和 Pyramid-RKV(执行静态单调递减层预算的基线),小预算(128-512 词元)的收益最大。 ReasonAlloc 与现有的令牌驱逐策略是即插即用的,并且引入的推理时间开销可以忽略不计。
