论文
通过假设树细化实现通才自主研究
Toward Generalist Autonomous Research via Hypothesis-Tree Refinement
摘要
科学进步取决于探索、实验和抽象的重复循环。研究人员测试候选人的方向,解释证据,并将所得的教训带入以后的尝试中。我们研究人工智能代理如何长期自主运行这个循环。我们介绍了 Arbor,这是一个自主研究的通用框架,它结合了长期协调员、短期执行员和假设树细化 (HTR),这是一种将假设、工件、证据和跨时间的提炼见解联系起来的持久树。协调员管理树上的全局研究策略,而执行者则在孤立的工作树中实施和测试各个假设。当结果返回时,Arbor 更新树,传播可重用的经验教训,细化搜索边界,并承认经过验证的改进。这种设计将自主研究从一系列本地尝试转变为一个累积过程,其中策略、执行和证据随着时间的推移而进行。我们在自主优化(AO)下评估 Arbor,这是一种操作设置,其中代理通过迭代实验改进初始研究工件,无需人工监督。在 模型训练 中的六项实际研究任务、利用工程和数据合成中,Arbor 在所有六项任务上都取得了最佳的保留结果,在相同的任务接口和资源预算下,获得了 Codex 和 Claude Code 的平均相对保留增益的 2.5 倍以上。在 MLE-Bench Lite 上,Arbor 在 GPT-5.5 上达到了 86.36% Any Medal,这是我们比较中最强的结果。