论文

AutoWorldModel-Bench:面向自动化世界模型研究的状态中心基准

AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research

智能体系统Agent任务评测

摘要

世界建模是一个悬而未决的领域:架构、训练目标与状态表示以复杂的方式相互作用,没有任何单一配方能在所有环境中占优。这使它成为让AI编码智能体充当自主研究者的理想试验场——在这种设定下,改进方向并未预先指定,有别于当前智能体基准中占主导的面向既定规格的工程任务。我们提出AutoWorldModel-Bench,一个闭环基准:前沿编码智能体在固定计算预算下自主改进一个给定的基础世界模型。该基准在统一的结构化状态表示下覆盖八个游戏环境——从每个游戏中提取的真值实体状态经由共享张量格式消费——从而将动力学建模与感知解耦,并实现每次运行分钟级的迭代。在64个会话中,Codex-5.4与Claude Opus 4.6除一个会话外均在留出测试集上改进了其基础模型,其中约一半(64个中的33个)取得实质性提升(Δ≥+0.10),其余改进较小但为正;在91%的会话中,胜出的编辑是对模型或训练的实质性更改,而非超参数微调。

AutoWorldModel-Bench:面向自动化世界模型研究的状态中心基准:论文配图
图C.2:Asteroids在1414个场景组、四种起始架构和两个智能体上的分场景复合值(0.1​c1+0.2​c10+0.7​chend0.1\,c_{1}+0.2\,c_{10}+0.7\,c_{h_{\mathrm{end}}})与相对起始的Δ\Delta。配色与表2一致:蓝色表示智能体最佳复合值量级,琥珀色/紫色表示Δ\Delta。