论文
NLPG:自进化语言Agent的自然语言策略梯度
NLPG: Natural-Language Policy Gradients for Self-Evolving Language Agents
摘要
大语言模型智能体越来越依赖复合程序进行检索、工具使用、推理和验证,但它们的失败往往源于局部程序决策。现有的强化学习和提示优化方法通常依赖于标量奖励或重复修改整个提示,因此很难在保留冻结Agent的同时捕获和重用程序改进。为了解决这个问题,我们提出了自然语言策略梯度(NLPG),这是一种外部策略记忆方法,用于在不改变模型参数或程序结构的情况下改进固定Agent。 NLPG 诊断执行跟踪,通过模块图向后传播下游反馈,并将重复出现的故障转换为路由本地自然语言更正,这些更正被聚合到有界策略更新中以供后续执行。在涵盖记忆、推理、指令遵循和证据验证的六项基准测试中,NLPG 的性能也比每个基准测试中列出的最强基准平均高出 8.71 个百分点。这些结果提供的证据表明,评估的程序经验可以转化为本地和可解释的策略更新,从而能够持续改进冻结Agent。