论文

TokenPilot:LLM 代理的缓存高效上下文管理

TokenPilot: Cache-Efficient Context Management for LLM Agents

上下文与知识上下文工程

摘要

由于 LLM 代理部署在长视野会话中,上下文积累会增加推理成本。现有方法利用文本修剪或动态内存驱逐来最小化词元占用空间;然而,它们不受约束的序列突变会改变布局,引入前缀不匹配和缓存失效。这揭示了文本稀疏性和提示缓存连续性之间的关键权衡。为了解决这个问题,我们提出了 TokenPilot,一个双粒度上下文管理框架。在全球范围内,摄取感知压缩充当框架工具,以稳定提示前缀并消除摄取门处的开放世界环境噪音。在本地,生命周期感知驱逐监控上下文片段的持续剩余效用,强制执行保守的批处理轮换计划,仅在任务相关性到期时卸载内容片段。在隔离和连续模式下对 PinchBench 和 Claw-Eval 进行的实验表明,TokenPilot 在隔离模式下分别降低了 61% 和 56% 的成本,在连续模式下分别降低了 61% 和 87% 的成本,同时与之前的系统相比保持了具有竞争力的性能。 TokenPilot 已集成到 LightRSI(https://github.com/zjunlp/RSI)。