论文

上下文语言模型:让模型直接管理可编辑上下文

Context Language Models

上下文与知识模型训练强化学习上下文工程Agentic RL

摘要

我们引入上下文语言模型(CLM),即原生管理自身上下文的语言模型。我们通过将上下文视为文件并允许模型对此文件进行无限制的更新来实现这一点。这使得模型能够了解上下文中最重要的维护内容,并自然地扩展到多Agent系统,其中多个Agent上下文作为文件共存。使用现有模型构建 CLM 零样本在各种任务中都优于 SOTA 上下文管理策略:在 BrowseComp-Plus 上,准确率提高了 11.4%,浮点计算量(FLOPs)减少21.5%;在 12 小时 EdgeBench 上,分数提高了 5%,浮点计算量(FLOPs)减少59%;在 24 小时多存储库Agent群任务中,在相同计算预算下,改进幅度增加65%。此外,通过将上下文管理从外部Harness控制转移到内在模型行为,CLM 自然地支持上下文管理策略的上下文学习和参数学习。我们证明,CLM 可以使用通过标准技能优化循环演变的自然语言指令进行引导,将上下文管理任务的留出集准确率提高高达 35.9 个点,同时减少计算量。我们还引入了一种针对 CLM 的在线强化学习方法,将 BrowseComp-Plus 上的 Qwen3.5-9B 性能提高了 47.6%,同时使用的 FLOP 减少了 12%。最后,我们为 CLM 服务共同设计了后缀缓存重用,在性能匹配的情况下,相对于标准 SGLang,服务器端计算量进一步减少了 35%。

上下文语言模型:让模型直接管理可编辑上下文:图1:上下文语言模型CLM将上下文视为文件,原生管理自身上下文。CLM可直接使用,并可通过上下文学习和强化学习进一步改进。(a)CLM引入的创造性上下文管理行为示例。(b)无需额外训练,CLM就在深度研究基准BrowseComp-Plus以及Agent群协同优化六个相互依赖仓库的Software World上,以更低成本改善表现。(c)CLM可遵循文本指令采用对应上下文管理策略(上),也可通过ContextBench上的技能演化循环改进策略(下)。(d)CLM可通过在线强化学习探索并内化上下文管理策略。在逐步GRPO中使用成功门控的效率优势,能够同时提高准确率和效率。
图1:上下文语言模型CLM将上下文视为文件,原生管理自身上下文。CLM可直接使用,并可通过上下文学习和强化学习进一步改进。(a)CLM引入的创造性上下文管理行为示例。(b)无需额外训练,CLM就在深度研究基准BrowseComp-Plus以及Agent群协同优化六个相互依赖仓库的Software World上,以更低成本改善表现。(c)CLM可遵循文本指令采用对应上下文管理策略(上),也可通过ContextBench上的技能演化循环改进策略(下)。(d)CLM可通过在线强化学习探索并内化上下文管理策略。在逐步GRPO中使用成功门控的效率优势,能够同时提高准确率和效率。