论文

SideQuest:面向长程 Agentic 推理的模型驱动 KV 缓存管理

SideQuest: Model-Driven KV Cache Management for Long-Horizon Agentic Reasoning

模型推理KV Cache

摘要

长时运行的 Agentic 任务(如深度研究)需要对分布在多个网页与文档中的信息进行多跳推理。在这类任务中,LLM 上下文被外部检索的 token 主导,导致内存占用快速增长并限制解码性能。尽管针对长上下文输入已有多种 KV 缓存压缩技术,我们发现现有启发式方法难以有效支持多步推理模型。我们用 SideQuest 应对这一挑战——一种新颖方法,让大型推理模型(LRM)本身通过推理上下文中 token 的有用性来执行 KV 缓存压缩。为防止与此管理过程相关的 token 污染模型记忆,我们将 KV 缓存压缩框化为与主推理任务并行执行的辅助任务。我们的评估使用仅用 215 个样本训练的模型,显示 SideQuest 在 Agentic 任务上将峰值 token 使用最多降低 65%,且准确率退化极小,优于基于启发式的 KV 缓存压缩技术。

SideQuest:面向长程 Agentic 推理的模型驱动 KV 缓存管理
图6:SideQuest 框架可扩展到记忆管理任务之外的各种辅助任务。