论文

经留出选择递归自演化智能体

Recursive Self-Evolving Agents via Held-Out Selection

智能体系统Agent HarnessAgent Skills智能体自我改进

摘要

通过发展自然语言工件(例如反射、工作流程、剧本、备忘单或优化提示),LLM 代理在没有权重更新的情况下不断得到改进,这些工件以冻结策略为条件。这些方法通常被报告为在有帮助的单一基准测试中取得胜利。我们对它们进行逐一研究,并呈现出更清晰的画面。我们介绍 RSEA,一种递归自我进化代理,它具有紧凑的三层自然语言状态:命令式策略、可重用技能和程序剧本。跨越几代,RSEA 会根据自己的轨迹重写所有三层,并使用严格的 keep-better 门,仅在不相交的保留分裂上回归时才提交候选层。通过四个不同的基准(ALFWorld、GAIA、(τ)-bench 和 WebShop)以及六个可靠的基准(ReAct、Reflexion、GEPA、AWM、ACE 和 Dynamic Cheatsheet),所有这些都在一个共享的本地主干网上进行评估,我们发现了三个主要结果。首先,没有任何神器能够普遍获胜。 RSEA 是 ALFWorld 上最强的单遍方法,达到 69.3%,而 ReAct (McNemar (p=0.015)) 为 64.6%,重试后达到 79.4%,是最好的整体结果。然而,以AWM为代表的具体工作流程归纳最适合强骨干工具使用任务。其次,不受保护的上下文演化是高方差且不安全的。 Dynamic Cheatsheet 可以在没有门禁的情况下在线管理上下文,在 ALFWorld 上接近最佳,达到 70.7%,但在 WebShop 上却表现不佳,得分为 0.14,而 ReAct 的得分为 0.43。第三,RSEA 严格的保留选择使得递归自进化单调安全:它在任何基准上都不会明显低于基础代理,并且当进化的上下文受到损害时,它会退回到普通的 ReAct。

经留出选择递归自演化智能体:论文配图
图 1:没有一种环境演化工件能够普遍获胜,而不受保护的演化是不安全的。在一个共享主干上跨四个基准的单遍方法(ALFWorld 7B;GAIA/τ\tau-bench/WebShop 30B)。 RSEA(红色)是 ALFWorld 上最强的单遍方法,并且在其他地方的表现从未明显低于 ReAct(灰色); AWM 最适合使用工具的任务; Dynamic Cheatsheet(在没有保留门的情况下在线管理上下文)在 ALFWorld 上接近最佳,但在 WebShop 上崩溃(0.14 与 ReAct 0.43)。 RSEA 严格的保留门使得进化单调安全。