论文
逃离上下文瓶颈:通过强化学习实现LLM智能体的主动上下文整理
Escaping the Context Bottleneck: Active Context Curation for LLM Agents via Reinforcement Learning
摘要
大型语言模型(LLM)在长程任务上表现不佳,原因在于“上下文瓶颈”与“迷失在中间”(lost-in-the-middle)现象:冗长环境累积的噪声在多轮交互中逐渐削弱推理能力。为解决这一问题,我们提出一个将上下文管理与任务执行解耦的共生框架。我们的架构将轻量级专用策略模型ContextCurator与强大的冻结基础模型TaskExecutor配对。ContextCurator经强化学习训练,主动降低工作记忆中的信息熵。它在激进修剪环境噪声的同时保留推理锚点,即对后续推断至关重要的稀疏数据点。在WebArena上,我们的框架将Gemini-3.0-flash的成功率从36.4%提升至41.2%,同时减少8.8%的token消耗(从47.4K降至43.3K)。在DeepSearch上,它取得57.1%的成功率(对比53.9%),同时将token消耗降低为原来的1/8。值得注意的是,7B规模的ContextCurator即可达到GPT-4o的上下文管理性能,为自主长程智能体提供了一种可扩展且计算高效的范式。
