论文

面向长程任务的智能体兼容上下文管理学习

Learning Agent-Compatible Context Management for Long-Horizon Tasks

上下文与知识模型训练强化学习上下文工程Agentic RL

摘要

LLM智能体在真实应用中越来越多地面临网页搜索、深度研究等长程任务,在这类任务中不断累积的上下文会导致长上下文退化与推理失败。先前工作通过上下文管理来缓解这一问题,采用智能体侧的上下文控制或摘要等固定策略,这需要训练智能体本身以进行适配——使其难以应用于闭源智能体,并忽视了不同智能体可能需要不同策略这一事实。我们提出自适应上下文管理(AdaCoM),通过灵活的修改动作与端到端强化学习训练一个外部LLM来管理冻结智能体的上下文。在网页搜索与深度研究基准上跨越多种智能体,AdaCoM在剪除陈旧内容的同时保留任务约束与任务进展,从而显著提升性能。学习到的策略揭示了一种保真度-可靠性权衡:原始ReAct性能更高的智能体受益于更高保真度的上下文保留,而性能较低的智能体则需要更激进的压缩才能保持在可靠的推理区间内。迁移实验表明,AdaCoM在能力相近的智能体之间(以原始ReAct性能衡量)泛化效果最好,这为构建智能体系统可复用的上下文管理器指出了一条务实路径。

面向长程任务的智能体兼容上下文管理学习:论文配图
图 1:自适应上下文管理 (AdaCoM) 概述。在每个代理步骤之前,外部 LLM 管理呈现给冻结代理的上下文。任务反馈仅更新管理器,使 AdaCoM 能够发现与代理兼容的上下文管理策略,而无需训练底层代理。