论文
ResearchClawBench:端到端自主科学研究的基准
ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research
摘要
AI 编码智能体越来越多地用于科学工作,但其端到端的自主研究能力仍然难以验证。我们推出 ResearchClawBench,这是一个评估 10 个科学领域 40 项任务的自主科学研究的基准。每个任务都以真实发表的论文为基础,提供相关文献和原始数据,并在评估过程中隐藏目标论文。专家策划的多模式评价标准将目标科学工件分解为加权标准,从而能够评估目标论文级别的重新发现,同时为新发现留出空间。我们通过轻量级 ResearchHarness 评估统一协议下的 7 个自主研究(自动研究)代理和 17 个本机 LLM。当前的系统距离可靠的重新发现还很远:最强的自主代理 Claude Code 的平均值为 21.5,最强的 ResearchHarness LLM Claude-Opus-4.7 的平均值为 20.7,LLM 前沿平均值仅为 26.5。误差分析表明,失败集中在实验方案不匹配、证据不匹配和科学核心缺失等方面。 ResearchClawBench 为衡量自主科学研究的进展提供了可重复的评估前沿。