论文
NatureBench:编码智能体能否与Nature-Family论文已发表的SOTA相匹配?
NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?
摘要
我们推出了 NatureBench,这是一个从同行评审的 Nature 系列出版物中提取的 90 项任务的跨学科基准,旨在评估 AI 编码智能体 是否能够超越复制,走向发现真正的科学问题。 NatureBench 建立在 NatureGym 的基础上,NatureGym 是一个自动化管道,可根据源论文构建标准化的、每个任务的容器化环境,解决限制先前代理研究基准可信度的环境碎片化问题。在严格禁用网络搜索的协议下评估 10 个前沿代理配置,我们发现在 g>0.1 标准下,最强的模型仅在 17.8% 的任务上超越了 SOTA。对方法路径的分析表明,智能体的成功主要是通过方法论转化,将科学任务转化为熟悉的监督预测问题,而不是通过真正的科学发明。失败的主要原因是方法选择错误和计算预算不足,而不是任务误解。我们发布了基准测试、NatureGym 管道以及具有维护者端复制的公共排行榜。代码:https://github.com/FrontisAI/NatureBench