论文
PACE:面向自演化智能体的任意时点有效接受测试
PACE: Anytime-Valid Acceptance Tests for Self-Evolving Agents
摘要
自我进化代理通过反复提出对自己的提示、技能或工作流程进行更改的建议,并在一小部分保留的集合中保留得分较高的代理来进行改进。几乎所有的努力都投入到了生成候选人的提议者身上;我们认为弱点是接受者,即决定是否进行更改的规则。针对相同的嘈杂的开发估计应用了数百次,无处不在的“如果分数上升则保留它”规则是不受控制的自适应多重测试:代理有效地攻击自己,积累错误的提交,使其搅动和漂移而不是改进。我们将提交重新定义为顺序假设检验,并提出 PACE(配对随时有效提交评估),这是一种免训练、随时有效的提交门。每个候选者都会在相同的实例上与现任者进行比较,并且仅当投注测试电子流程积累决定性证据时才会提交,提前停止以保存评估,并将每个候选者的错误提交概率控制在用户设置的级别,即使在可选停止(每个决策保证)下也是如此。在 GSM8K、SVAMP 和 ARC-Challenge 上的提示级别自我进化的 Qwen2.5 代理 (0.5B-3B) 上,当真正的改进隐藏在嘈杂的提案中时,贪婪接受会提交 30-42% 的错误和 10-33% 的有害编辑,而 PACE 会提交真正的改进,而基本上没有其他任何东西,以极低的方差和约 18% 的评估成本降低约 18% 的评估成本,匹配贪婪的保留准确性。由于没有真正的增益,贪婪每次运行都会进行 13-21 次虚假自我修改(72-100% 错误),并使最脆弱的代理降低 4.9 个点,而 PACE 保持在基线水平。自进化的可靠性取决于接受者,而不仅仅是提议者。
