RoboPhD:在紧张评估预算下进化多样的复杂智能体
RoboPhD: Evolving Diverse Complex Agents Under Tight Evaluation Budgets
摘要
2026年,对LLM引导的智能体制品进化的兴趣爆发式增长,GEPA与Autoresearch等系统证明LLM能够跨多样领域迭代改进提示、代码与智能体架构。随着采用加速,一个核心问题浮现:在相同信息、相同种子智能体与相同目标下,哪种优化算法能在相同评估预算下取得最佳结果?当评估成本高昂时——例如需要人类判断或多次LLM调用——这一问题变得尤为关键。我们首次系统比较了三种优化范式——Elo锦标赛选择(RoboPhD)、基于Pareto的选择(GEPA)与贪心爬山(Autoresearch)——覆盖抽象推理、云调度、SQL生成与金融问答四个基准,全部在1,500次评估的固定预算下进行。RoboPhD引入免验证进化:它不在训练与验证之间拆分预算,而是利用训练数据上的Elo竞争同时评估智能体并驱动进化。三个系统都接收带有诊断性print()语句的种子智能体,进化可以使其增长,从而实现自我插桩的智能体,为其进化后继者开发出信息量越来越丰富的诊断。在单一默认配置下,RoboPhD在四个基准中的三个上同时优于GEPA与Autoresearch,仅在最简单的任务上落败,而该任务的获胜解(来自我们的Autoresearch适配)所需代码不足90行。在ARC-AGI上,RoboPhD将一个22行的种子智能体进化为1,013行的多策略系统,使用Gemini 3.1 Flash Lite作为求解器将准确率从27.8%提升至65.8%。我们以MIT许可证发布RoboPhD作为多功能工具包,提供简单的optimize_anything() API用于进化多样的复杂智能体。