论文
持续上下文管理
Continuous Context Management
摘要
长时域大语言模型 (LLM) Agent通常会保留其完整的交互历史记录,直到在预定义阈值触发压缩为止。我们研究了连续上下文管理(CCM),它每次都会执行压缩,以防止交互历史记录在活动提示中累积。在每一回合,CCM Agent都会发出更新的内存以及环境操作;它的下一个提示包含原始任务、保留的记忆和最新的观察结果,而不是完整的记录。我们首先使用 Claude Sonnet 4.6、Claude Opus 4.6、GLM-5 和 Kimi K3 在 TerminalBench-2 上评估 CCM,无需进行微调。 CCM 大大减少了累积输入使用量和活动提示大小,尽管它会降低大多数模型的任务成功率,同时保留 Kimi K3 的性能。我们使用具有特权全历史蒸馏的 GRPO 来改进开放重量模型中的 CCM。学生初始模型的冻结副本根据学生的rollout重建的完整历史记录对每个采样的学生动作进行评分,从而提供密集的动作词元监督,而无需单独的教师rollout或参考解决方案。在 WebShop 上,该目标在两个评估的模型尺度上都显着提高了 CCM 相对于 GRPO 的性能,并且超过了 Qwen3-4B-Instruct 的全历史 GRPO,但 Qwen3-8B 则没有。在 Endless Terminals 上,增强方法比 GRPO 提供了适度的改进,两种 CCM 策略都优于未经训练的完整历史基线。这些结果表明,对于在保留上下文大幅减少的情况下运行的Agent来说,CCM 是一种可行的推理范式,并且可以通过具有特权的全历史蒸馏的强化学习来提高其性能。