论文

自我改进的体验式反思学习 LLM 座席

Experiential Reflective Learning for Self-Improving LLM Agents

上下文与知识记忆Agent记忆

摘要

大语言模型 (LLM) 的最新进展使得能够开发能够进行复杂推理和多步骤问题解决的自主代理。然而,这些代理很难适应专门的环境,并且不利用过去的交互,无论他们积累的经验如何,都从头开始处理每项新任务。我们引入体验式反思学习(ERL),这是一种简单的自我完善框架,可以通过体验式学习实现快速环境适应。 ERL 反映任务轨迹和结果以生成启发式方法,捕获跨任务传递的可操作的经验教训。在测试时,根据当前任务检索相关启发式方法并将其注入代理的上下文中以指导执行。在 Gaia2 基准上,ERL 比 ReAct 基准提高了 7.8% 的成功率,任务完成可靠性大幅提高,并且优于之前的体验式学习方法。通过系统化的消融,我们发现选择性检索至关重要,并且启发式方法比少样本轨迹提示提供了更多可转移的抽象概念。这些结果表明,反思单次尝试经验以提取可转移的启发式方法可以有效地进行代理自我改进。