论文

ContextBudget:面向长程搜索智能体的预算感知上下文管理

ContextBudget: Budget-Aware Context Management for Long-Horizon Search Agents

上下文与知识模型训练强化学习上下文工程Agentic RL

摘要

基于LLM的智能体在长程推理上展现出强大潜力,但其上下文规模受部署因素(如内存、延迟与成本)限制,形成受限的上下文预算。随着交互历史增长,这带来在保留过往信息与不超出上下文上限之间的权衡。为应对这一挑战,我们提出预算感知上下文管理(BACM),将上下文管理形式化为带上下文预算约束的序列决策问题。它使智能体能够在纳入新观察前评估可用预算,并决定何时以及压缩多少交互历史。我们进一步开发BACM-RL,一种端到端的基于课程学习的强化学习方法,可在不同上下文预算下学习压缩策略。在组合式多目标问答与长程网页浏览基准上的实验表明,BACM-RL在不同模型规模与任务复杂度下均持续优于先前方法,在高复杂度设置下相对强基线取得超过$1.6\times$的增益,且在预算缩小时仍保持显著优势,而大多数方法此时性能呈下行趋势。

ContextBudget:面向长程搜索智能体的预算感知上下文管理:论文配图
图 1:拟议框架概述。 (a) 在加载待观察的观察之前,代理首先观察预算条件状态 bt=(st,rt,|ot|)b_{t}=(s_{t},r_{t},|o_{t}|)。 (b) 以 btb_{t} 为条件,策略选择细化操作 utu_{t} 来执行 Null、部分或完整提交块聚合,产生更新的上下文 𝒞t′\mathcal{C}^{\prime}_{t}。 (c) 该政策在逐步收紧的预算课程下通过多轮 GRPO 进行训练,其中只有满足背景预算的轨迹才有助于奖励和优化。