论文
逃离自我确认陷阱:代理体验学习的执行-提取-验证范式
Escaping the Self-Confirmation Trap: An Execute-Distill-Verify Paradigm for Agentic Experience Learning
摘要
经验驱动的自我进化对于 大语言模型 (LLM) 智能体通过开放世界交互进行改进至关重要。然而,现有的经验学习方法大多依赖于单代理循环,即同一个代理执行任务、总结结果并确定记忆内容。这种设置使代理容易陷入自我确认陷阱:错误但自洽的轨迹被错误地识别为成功的经验,导致检索和重用期间累积错误。为了解决这个问题,我们提出了 EDV,一种用于可靠经验学习的执行-提取-验证框架。在执行阶段,多个异构智能体并行探索同一任务空间,以生成不同的候选轨迹。在 Distill 阶段,专门的第三方代理对这些轨迹进行比较分析,以产生候选体验,减少以执行者为中心的总结偏差。在验证阶段,执行组通过共识机制验证候选者,只有经过批准的经验才会写入共享或私有内存。通过解耦这三个阶段,EDV 将经验学习从孤立的自我反思转变为协作构建,在记忆插入之前过滤错误和嘈杂的内容。我们在三个具有挑战性的长期基准测试上评估 EDV:tau2-bench、Mind2Web 和 MMTB。结果表明,EDV 始终优于强大的基线,验证了可靠的体验构建对于稳健的智能体自我进化至关重要。我们的代码可在 https://github.com/shidingz/EDV 获取。