论文

我们离真正的自动化研究还有多远?

How Far Are We From True Auto-Research?

智能体系统Agent任务评测

摘要

近期的自动化研究系统已能产出完整论文,但可行性不等于质量,学界仍缺乏对智能体生成论文实际水平的系统研究。我们提出ResearchArena,一个最小化脚手架,让现成智能体(使用Opus 4.6的Claude Code、使用GPT-5.4的Codex以及使用K2.5的Kimi Code)在仅有的轻量指导下自行完成完整研究循环(构思、实验、论文写作、自我完善)。在13个计算机科学种子课题、每个智能体-领域组合3次试验下,ResearchArena产出117篇智能体生成论文,每篇从三个互补视角评估:仅看稿件的评审(SAR)、智能体在检查工作区的同时审阅稿件的工件感知同行评审(PR),以及人工开展的元评审。仅用SAR时图景乐观:Claude Code获得最高分,超过Analemma的FARS,并追平人类ICLR 2025投稿的加权平均水平,表明最小脚手架的智能体能产出在仅看稿件的评审中看似有竞争力的论文。然而人工检查揭示这一图景被夸大:SAR分数与其真实接收决定的一致性很差,且奖励似是而非的包装而不核实实验实质。在工件感知PR下分数急剧下滑,人工审计认定实验严谨性是主要瓶颈,并分解为三种失败模式(伪造结果、实验功效不足、计划与执行不匹配),且高度依赖所用智能体:Codex的论文-工件不符/伪造引用率为5%/8%,而Kimi Code为77%/72%,约15倍的差距对应着各智能体形成的不同研究人格。117篇智能体生成论文中没有一篇达到顶级会议的接收门槛。这表明我们距离真正的自动化研究仍有差距。

我们离真正的自动化研究还有多远?:论文配图
图1:ResearchArena流水线整体结构,即论文提出的自动化科研系统框架。