论文

学习自动化发现的ARTS搜索之道

Learning the ARTS of Search for Automated Discovery

智能体系统模型训练强化学习Agent 规划Agentic RL

摘要

科学发现可形式化为假设与实验空间上的迭代搜索过程。当代方法以MCTS等启发式导航该空间。这些算法把假设的优劣与其实验执行的质量混为一谈。因此——有前景但执行初步的假设被排在执行精良但平庸的假设之下。此外——既有方法随搜索推进剪枝搜索日志——因为累积历史超出上下文窗口。我们提出面向树搜索的智能体推理(ARTS)——部署推理语言模型导航该空间。模型检视先前执行日志——诊断较早失败源于错误实现还是坏假设——并选择下一步构建的假设。为缓解上下文长度挑战——ARTS用测试时训练把搜索树知识注入模型权重。在MLGym与MLEBench的22个任务上——我们表明ARTS超越领先算法——归一化分数相对改进超15.3%。经测试时训练——Qwen3-4B智能体能匹敌Gemini-3 Pro与GPT o3-reasoning等闭源前沿模型——推理成本最高低5倍。我们进一步观察到:在部分可观测RL任务上——测试时训练的Qwen3-4B科学家超越带o3科学家的ARTS——重新发现被启发式方法剪掉的人类最佳循环记忆解。

学习自动化发现的ARTS搜索之道:论文配图
图 1:ARTS 的单个搜索步骤。节点是一个经过验证的实验,包含假设、代码、日志和分数。从当前的搜索树(要展开的树)开始,科学家检查候选节点以及每个节点得分的原因,然后选择最有希望的节点而不是得分最高的节点。在此图中,它选择分数为 0.100.10 的节点,因为低分数来自训练中而不是弱假设(节点选择)。通过口头采样,科学家提出不同的概率假设和样本之一,由执行器实施、运行和评分(节点扩展)。生成的节点 (0.550.55) 成为新的最佳节点并添加到树中。这个循环不断重复,直到预算用完。红色节点是已探索的候选节点,绿色标记选择用于扩展的节点,蓝色标记新添加的节点。