论文

经成对验证器的免奖励进化智能体

Reward-Free Evolving Agents via Pairwise Validator

智能体系统Agent 架构与控制循环Agent Harness

摘要

自进化智能体回路反复提议智能体的一个微调版本(其提示模板或程序),并基于每次迭代的质量信号接受或拒绝变更。设计该信号常是项目中最昂贵的部分:可靠的标量奖励需要领域专长与标注样例——其组装成本与智能体的底层任务一样高。我们提议以成对验证器取代接受/拒绝门处的标量:一个冻结LLM,给定父代与子代候选,返回哪个更好的二元裁决。成对判断因对比性而通常比绝对打分更容易、更稳定——缓解对严格量表校准的需要。验证器也无需自身训练。我们把验证器集成进三个已发布的自进化引擎(GEPA、ADRS、ShinkaEvolve),并报告两种形态:Adaptive Focus——保留引擎既有的验证集父代选择;Soft Elo——让验证器的裁决驱动父代选择,使验证集奖励也被放下。跨多个智能体与两种工件基底(提示与代码):我们的方法在我们评估的大多数设置上匹敌或超过全奖励基线,且该模式经受跨家族验证器替换。成对门因此是逐步奖励设计的即插即用替代——以有竞争力的任务准确率免去标注成本。

经成对验证器的免奖励进化智能体:论文配图
图 1:我们的框架概述。自我进化的代理循环迭代提议、接受或拒绝(门)和选择。门传统上使用每步任务奖励来比较父级和子级提示候选分数。我们用成对验证器 (LLM) 替换该奖励,该验证器返回对父项和子项的二元判决。从左到右,完全奖励基线(左)保留了训练奖励和验证奖励;自适应焦点(中)仅交换大门,放弃火车奖励; Soft Elo(右)进一步交换了父母的选择,变得无奖励。