论文
经成对验证器的免奖励进化智能体
Reward-Free Evolving Agents via Pairwise Validator
摘要
自进化智能体回路反复提议智能体的一个微调版本(其提示模板或程序),并基于每次迭代的质量信号接受或拒绝变更。设计该信号常是项目中最昂贵的部分:可靠的标量奖励需要领域专长与标注样例——其组装成本与智能体的底层任务一样高。我们提议以成对验证器取代接受/拒绝门处的标量:一个冻结LLM,给定父代与子代候选,返回哪个更好的二元裁决。成对判断因对比性而通常比绝对打分更容易、更稳定——缓解对严格量表校准的需要。验证器也无需自身训练。我们把验证器集成进三个已发布的自进化引擎(GEPA、ADRS、ShinkaEvolve),并报告两种形态:Adaptive Focus——保留引擎既有的验证集父代选择;Soft Elo——让验证器的裁决驱动父代选择,使验证集奖励也被放下。跨多个智能体与两种工件基底(提示与代码):我们的方法在我们评估的大多数设置上匹敌或超过全奖励基线,且该模式经受跨家族验证器替换。成对门因此是逐步奖励设计的即插即用替代——以有竞争力的任务准确率免去标注成本。
