论文

CLEAR:通过智能体反思的经验对比学习实现上下文增强

CLEAR: Context Augmentation from Contrastive Learning of Experience via Agentic Reflection

上下文与知识模型训练强化学习上下文工程记忆Agentic RLAgent记忆

摘要

大语言模型智能体依赖有效的模型上下文来获取任务相关信息以支持决策。许多现有的上下文工程方法主要依赖从过去经验生成的上下文,以及复用这些上下文的检索机制。然而,从过去任务检索到的上下文必须由执行智能体加以调整才能适应新情况,这给底层LLM带来了额外的推理负担。为解决这一局限,我们提出CLEAR(Contrastive Learning of Experience via Agentic Reflection,经由智能体反思的经验对比学习),一种生成式上下文增强框架。CLEAR首先使用一个反思智能体对过去的执行轨迹进行对比分析,并为每个观察到的任务总结有用的上下文。这些总结随后被用作监督微调数据来训练一个上下文增强模型(CAM)。随后我们用强化学习进一步优化CAM,其奖励信号通过运行任务执行智能体获得。通过学会生成任务特定知识而非从过去检索知识,CAM产出的上下文能更好地贴合当前任务。我们在AppWorld和WebShop基准上进行了全面评估。实验结果表明,CLEAR持续优于强基线。与基线智能体相比,它将AppWorld测试集上的任务完成率从72.62%提升到81.15%,并将WebShop子集上的平均奖励从0.68提升到0.74。我们的代码已公开发布于https://github.com/awslabs/CLEAR。

CLEAR:通过智能体反思的经验对比学习实现上下文增强:论文配图
图 1:CLEAR 训练框架设计。首先,我们将每个任务 qi∼𝒟trainq_{i}\sim\mathcal{D}_{\text{train}} 执行 mm 次,并收集 qiq_{i} 的重播组 Γi\Gamma_{i}。我们使用反射代理 πR\pi^{R} 为每个 qiq_{i} 生成实例级指令 cic_{i},收集到 𝒟SFT\mathcal{D}_{\text{SFT}} 中。然后,我们从开源 LLM 初始化 CAM,并在 𝒟SFT\mathcal{D}_{\text{SFT}} 上执行 SFT。最后,我们进一步对经过训练的 CAM 执行强化学习,利用 πE\pi^{E} 的奖励信号来更新 CAM 的策略。