论文
CoMem:具有解耦长上下文模型的上下文管理
CoMem: Context Management with A Decoupled Long-Context Model
摘要
上下文管理使代理模型能够通过对先前交互历史的迭代总结来解决长期任务。然而,此过程通常会产生额外汇总词元的大量解码开销,这会显着影响部署时的端到端响应延迟。在本文中,我们介绍了 CoMem,这是一种新颖的框架,它将内存管理与主代理工作流程分离,使这些流程能够并行执行。我们提出了一个 $k$ 步的异步管道,它将内存模型的总结与代理的推理重叠,有效地掩盖了上下文处理的延迟。为了确保这种异步设置下的鲁棒性,我们引入了一种奖励驱动的训练策略,该策略可以调整内存模型以捕获足够的统计数据以供代理决策。理论分析证实,与耦合架构相比,CoMem 提供了卓越的效率-效果权衡。我们在 SWE-Bench-Verified 上进行的广泛实验结果表明,CoMem 比普通长上下文解决方案提供了 1.4 倍的延迟改进,同时保留了大部分性能。此外,我们证明这些延迟增益随着系统吞吐量的增加而有利地扩展,为代理推理和内存压缩的独立优化提供了模块化路径。