论文
面向长程LLM智能体服务的并行上下文压缩
Parallel Context Compaction for Long-Horizon LLM Agent Serving
摘要
长程LLM智能体不断累积的对话历史最终会超出模型的上下文窗口。基于LLM摘要的上下文压缩能保持对话有界,但摘要本质上是有损的,且阻塞式调用会让智能体推理停顿数十秒。此外,由于提示指令大多被忽视,运营者无法对摘要体量进行细粒度控制;随着上下文增长,模型产出的输出token数量与它保留的信息量在多次运行间大幅波动,使智能体保留的知识在不同运行间不可预测。我们提出面向长程智能体流程的并行压缩,并在HotpotQA多跳问答与LoCoMo长上下文对话基准上,以覆盖8B到120B参数、混合稠密与MoE架构、含推理与非推理模型的四个骨干,与顺序同步基线进行对比刻画。并行压缩让运营者对摘要体量获得细粒度、可预测的控制,并支持对每个分块进行更有针对性的提示工程。在匹配的压缩解码量下,与顺序基线相比,它降低了端到端墙钟时间并提升了压缩吞吐。
