论文
ResearchGym:在真实 AI 研究上评估语言模型智能体
ResearchGym: Evaluating Language Model Agents on Real-World AI Research
摘要
我们提出 ResearchGym,一个在端到端研究上评估 AI 智能体的基准与执行环境。为实例化,我们改造了 ICML、ICLR 和 ACL 的五篇 oral 与 spotlight 论文。从每篇论文的代码库中,我们保留数据集、评估工具与基线实现,但扣留论文提出的方法。由此得到五个容器化任务环境,共包含 39 个子任务。在每个环境中,智能体必须提出新假设、运行实验,并尝试在论文指标上超越强人类基线。在对 GPT-5 驱动智能体的受控评估中,我们观察到显著的能力-可靠性差距。该智能体仅在 15 次评估中的 1 次(6.7%)超过代码库提供的基线,幅度为 11.5%,且平均只完成 26.5% 的子任务。我们识别出反复出现的长视界失败模式,包括缺乏耐心、时间与资源管理不善、对弱假设过度自信、难以协调并行实验以及上下文长度的硬性限制。然而在单次运行中,该智能体超越了一项 ICML 2025 Spotlight 任务的解,表明前沿智能体偶尔能达到最优性能,但并不可靠。我们还评估了 Claude Code(Opus-4.5)和 Codex(GPT-5.2)等专有智能体框架,它们表现出类似差距。ResearchGym 为自主智能体在闭环研究上的系统评估与分析提供基础设施。
