论文

Heuresis:自主AI研究智能体在质量、多样性与新颖性上的搜索策略

Heuresis: Search Strategies for Autonomous AI Research Agents Across Quality, Diversity and Novelty

智能体系统模型训练强化学习Agent 规划Agentic RL

摘要

自主AI研究承诺加速机器学习的科学进步。为实现该目标——当前基于LLM的智能体需要超越只写代码——掌握对同时高性能、多样且新颖想法的探索。为此——我们介绍Heuresis——把研究管线抽象为一组通用、可组合原语的框架——支持机器学习研究中的开放式科学探索。我们实现六种搜索策略:贪心基线、两种基于档案的(MAP-Elites、Go-Explore)、一种演化的(岛屿)与两种发散的(好奇、Omni)——并在三个域(LLM预训练、自策略RL、模型遗忘)沿三轴(质量、多样性、新颖性)评估——共3,222次评分运行。我们发现完全新颖的想法罕见。全部评分运行中没有任何想法被评为“原创”——只有少数达到与先前工作“轻微相似”。而且新颖想法从未接近最高性能的已知配方分数。跨六策略三域——只有一个此类想法进入质量前10。我们还观察到智能体在执行期间诉诸多种奖励黑客技术(1,628次评分运行中40次确证的伪造)——检测它们对保持搜索忠于任务是必要的。结果表明:尽管当前搜索与质量-多样性策略能引导生成想法落在质量、多样性与新颖性轴的何处——它们并不扩展质量-新颖性前沿。弥合该缺口是通往永续自主科学进步终极目标的开放挑战。代码见 github.com/a-antoniades/Heuresis。

Heuresis:自主AI研究智能体在质量、多样性与新颖性上的搜索策略:论文配图
图 1:代理循环内部结构。创意者 (1) 提出代码更改,执行者 (2) 实现它,共享可交换代理后端。多个创意者-执行者对异步并行运行。 MemoryServer (3) 存储框架记录的实验和代理编写的学习内容,可通过语义 KNN 或 SQL 进行查询。 GradingServer (4) 对跑步进行评分; HackerJudge (5) 审核工作区并发出三态判决,可选择触发无代理重新评分。 SearchStrategy (6) 更新其存档并选择下一个父工作区 (7) 以关闭循环。