论文
请求顺序会改变答案:滚动智能体选择性 KV 复用的缓存历史敏感性
Request Order Matters: Cache-History Sensitivity in Selective KV-Cache Reuse for Rolling Agents
摘要
长期运行的智能体会反复调用 LLM,在保留大部分文档窗口的同时,移除旧文档并追加新文档。这类滚动更新打破精确前缀缓存,因此促使系统采用选择性重计算的非前缀 KV 复用。我们发现,持久 KV 复用与选择性重计算可能依赖历史:在滚动智能体工作负载中,即使当前提示不变,之前处理的请求也可能改变答案。在同为 5% 的重计算预算下,按文档边界对齐重计算,将不同请求顺序之间的答案变异率从 CacheBlend token top-$k$ 策略的 69.0% 降到 26.1%。当每个提示都在不同先前请求序列之后评估时,相对 token top-$k$,文档对齐方法对完整预填充结果的保真度提高 34.5—52.5 个百分点;两种策略都获得约 5.7 倍的中位 TTFT 加速。消融实验表明,在这一滚动智能体工作负载中,连续性是与稳健选择性重计算相关的主要因素。
