论文
学习自动化发现的ARTS搜索之道
Learning the ARTS of Search for Automated Discovery
摘要
科学发现可形式化为假设与实验空间上的迭代搜索过程。当代方法以MCTS等启发式导航该空间。这些算法把假设的优劣与其实验执行的质量混为一谈。因此——有前景但执行初步的假设被排在执行精良但平庸的假设之下。此外——既有方法随搜索推进剪枝搜索日志——因为累积历史超出上下文窗口。我们提出面向树搜索的智能体推理(ARTS)——部署推理语言模型导航该空间。模型检视先前执行日志——诊断较早失败源于错误实现还是坏假设——并选择下一步构建的假设。为缓解上下文长度挑战——ARTS用测试时训练把搜索树知识注入模型权重。在MLGym与MLEBench的22个任务上——我们表明ARTS超越领先算法——归一化分数相对改进超15.3%。经测试时训练——Qwen3-4B智能体能匹敌Gemini-3 Pro与GPT o3-reasoning等闭源前沿模型——推理成本最高低5倍。我们进一步观察到:在部分可观测RL任务上——测试时训练的Qwen3-4B科学家超越带o3科学家的ARTS——重新发现被启发式方法剪掉的人类最佳循环记忆解。
