经留出选择递归自演化智能体
Recursive Self-Evolving Agents via Held-Out Selection
摘要
通过发展自然语言工件(例如反射、工作流程、剧本、备忘单或优化提示),LLM 代理在没有权重更新的情况下不断得到改进,这些工件以冻结策略为条件。这些方法通常被报告为在有帮助的单一基准测试中取得胜利。我们对它们进行逐一研究,并呈现出更清晰的画面。我们介绍 RSEA,一种递归自我进化代理,它具有紧凑的三层自然语言状态:命令式策略、可重用技能和程序剧本。跨越几代,RSEA 会根据自己的轨迹重写所有三层,并使用严格的 keep-better 门,仅在不相交的保留分裂上回归时才提交候选层。通过四个不同的基准(ALFWorld、GAIA、(τ)-bench 和 WebShop)以及六个可靠的基准(ReAct、Reflexion、GEPA、AWM、ACE 和 Dynamic Cheatsheet),所有这些都在一个共享的本地主干网上进行评估,我们发现了三个主要结果。首先,没有任何神器能够普遍获胜。 RSEA 是 ALFWorld 上最强的单遍方法,达到 69.3%,而 ReAct (McNemar (p=0.015)) 为 64.6%,重试后达到 79.4%,是最好的整体结果。然而,以AWM为代表的具体工作流程归纳最适合强骨干工具使用任务。其次,不受保护的上下文演化是高方差且不安全的。 Dynamic Cheatsheet 可以在没有门禁的情况下在线管理上下文,在 ALFWorld 上接近最佳,达到 70.7%,但在 WebShop 上却表现不佳,得分为 0.14,而 ReAct 的得分为 0.43。第三,RSEA 严格的保留选择使得递归自进化单调安全:它在任何基准上都不会明显低于基础代理,并且当进化的上下文受到损害时,它会退回到普通的 ReAct。
