论文
LLM 代理的实用在线 KV 缓存压缩:实证研究
Practical Online KV Cache Compaction for LLM Agents: An Empirical Study
摘要
LLM 代理积累了推理步骤、工具调用和环境反馈的长轨迹,使得 KV 缓存成为主要的推理瓶颈。 KV 缓存压缩可以降低这种成本,但大多数先前的方法都假设一个静态上下文,其中未来的查询是已知的或可以离线近似。相反,代理需要在线压缩:在知道未来的相关性之前,必须使用对于推理路径来说足够便宜的代理查询来压缩新信息。我们研究跨词元驱逐(TE)和注意力匹配(AM)的在线压缩,适应紧凑代理轮流并比较廉价的代理源,例如边界、重复预填充和延迟的下一代查询。 BrowseComp-Plus 和 WideSearch 上的实验表明,立即压缩通常会损害性能,而延迟压缩以使用代理的未来查询可以弥补大部分差距。此外,在不完美代理下,TE 通常比 AM 更稳健。在不同规模的模型中,TE 保留了大部分准确性,同时将 KV 缓存减少了 80%,并且可以在无压缩基准的基础上提高吞吐量。这些结果将代理查询选择定位为实际在线 KV 压缩的核心设计选择。