论文
ZoomR:通过多粒度键值检索进行内存高效推理
ZoomR: Memory Efficient Reasoning through Multi-Granularity Key Value Retrieval
摘要
大语言模型 (LLM) 在复杂的推理任务中表现出了出色的性能,但在得出最终答案之前通常需要产生很长的中间想法。在生成过程中,LLM 依赖键值 (KV) 缓存进行自回归解码。然而,KV 缓存的内存占用量随着输出长度的增加而增加。先前关于 KV 缓存优化的工作主要集中在压缩长输入上下文,同时保留完整的 KV 缓存用于解码。对于需要长时间输出生成的任务,这会导致计算和内存成本增加。在本文中,我们介绍了 ZoomR,这是一种新颖的方法,使 LLM 能够自适应地将冗长的推理思想压缩为摘要,并使用动态 KV 缓存选择策略来利用这些摘要,同时还策略性地“放大”细粒度的细节。通过在解码过程中使用摘要键作为粗粒度索引,ZoomR 使用查询来检索仅最重要想法的详细信息。这种分层策略通过避免每个步骤的全缓存关注,显着减少了内存使用量。数学和推理任务的实验表明,与基线相比,我们的方法实现了具有竞争力的性能,同时将推理内存需求减少了 4倍以上。这些结果表明,多粒度 KV 选择可以实现更高效的内存解码,特别是对于长输出生成。