论文

PACE:面向自演化智能体的任意时点有效接受测试

PACE: Anytime-Valid Acceptance Tests for Self-Evolving Agents

智能体系统Agent 动作执行与治理Agent Skills智能体自我改进

摘要

自我进化代理通过反复提出对自己的提示、技能或工作流程进行更改的建议,并在一小部分保留的集合中保留得分较高的代理来进行改进。几乎所有的努力都投入到了生成候选人的提议者身上;我们认为弱点是接受者,即决定是否进行更改的规则。针对相同的嘈杂的开发估计应用了数百次,无处不在的“如果分数上升则保留它”规则是不受控制的自适应多重测试:代理有效地攻击自己,积累错误的提交,使其搅动和漂移而不是改进。我们将提交重新定义为顺序假设检验,并提出 PACE(配对随时有效提交评估),这是一种免训练、随时有效的提交门。每个候选者都会在相同的实例上与现任者进行比较,并且仅当投注测试电子流程积累决定性证据时才会提交,提前停止以保存评估,并将每个候选者的错误提交概率控制在用户设置的级别,即使在可选停止(每个决策保证)下也是如此。在 GSM8K、SVAMP 和 ARC-Challenge 上的提示级别自我进化的 Qwen2.5 代理 (0.5B-3B) 上,当真正的改进隐藏在嘈杂的提案中时,贪婪接受会提交 30-42% 的错误和 10-33% 的有害编辑,而 PACE 会提交真正的改进,而基本上没有其他任何东西,以极低的方差和约 18% 的评估成本降低约 18% 的评估成本,匹配贪婪的保留准确性。由于没有真正的增益,贪婪每次运行都会进行 13-21 次虚假自我修改(72-100% 错误),并使最脆弱的代理降低 4.9 个点,而 PACE 保持在基线水平。自进化的可靠性取决于接受者,而不仅仅是提议者。

PACE:面向自演化智能体的任意时点有效接受测试:论文配图
图 1:PACE 概述。自我进化代理提出修改建议,并且必须决定是否提交每一项修改。贪婪的接受会让任何重复使用的开发分数的候选人保持上升——p-hacking一个嘈杂的、回收的信号。相反,PACE 运行任何时间有效的配对测试(McNemar 不一致对 ++ 下注电子过程),仅当证据跨越 E≥1/αE\geq 1/\alpha 时才提交,这将每个候选者在可选停止下的错误提交概率限制在 α\alpha。新保留的池仅审核决策以进行衡量。