论文

作为人工智能研究世界模型的语言模型

Language Models as AI Research World Models

模型评测应用与实践模型能力评测科学研究

摘要

人工智能研究代理使提出、实施和评估实验的周期自动化,开辟了一条递归自我完善的道路。然而,他们提出实验的能力超过了在真实环境中执行实验的能力,这使得结果预测成为在有限的实验预算下持续自我改进的关键能力。我们研究作为研究世界模型(RWM)的语言模型,它预测跨研究环境的候选干预的结果。我们的评估借鉴了来自 9 个研究环境的 2,600 多个实验记录,涵盖预训练、训练后和推理,代表超过 171,000 个 H100 GPU 小时的实验。从真实实验经验中获得的研究知识提高了 RWM 对同一环境中看不见的干预措施的预测 (Spearman +0.27),并且可以跨环境重复使用。例如,仅使用 OLMo3、Marin 和 Nanochat 的预训练经验,与零经验设置相比,RWM 将 Qwen3 环境中的选择遗憾减少了 78%。这些 好处扩展到固定选择预算下的多轮自动研究:具有环境内和跨环境研究知识的 RWM 分别将获得的最佳收益提高了 15.8% 和 11.6%。用作 RWM 的 13 种语言模型的消融表明,添加研究知识比单独改变模型或增加推理工作更能提高干预排名。这些发现支持语言模型作为 RWM,并激励为未来的 RWM 训练积累实验数据。