论文
ContextPilot:用细粒度强化学习训练智能体主动管理上下文
ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL
摘要
长程智能体任务需要 大语言模型 (LLM) 迭代地检索、集成和维护多轮交互中的分散信息,但保留所有交互历史记录会导致工作上下文不断增长。最近的主动上下文管理方法允许模型使用专门的工具编辑自己的工作上下文,但它们仍然面临三个关键限制:(1)有限的工具集仅限于搜索、删除和摘要,不支持全局规划、长期记忆和自适应压缩; (2) 低效的探索,尽管上下文管理行为对最终结果的影响不同,但统一对待它们; (3) 粗粒度信用分配,将最终的轨迹级奖励分配给 RL 期间的所有中间上下文编辑操作。为了弥补这些差距,我们引入了 ContextPilot,这是一个用于长程智能体推理的主动上下文管理框架。我们的方法通过规划、长期记忆和软上下文卸载工具系统地增强了工具集。我们进一步提出了一种为上下文管理量身定制的强化学习方法,该方法使用上下文和熵变化来识别分支采样的关键编辑决策,并从通过相应上下文编辑操作的所有分支轨迹估计操作级别优势。长上下文 QA 和深度搜索任务的实验表明,ContextPilot 通过更紧凑的工作上下文实现了更强的性能,在各种基础模型和基准测试中始终优于现有基线。代码可在 https://github.com/Tencent/ContextPilot 获取。