论文
AutoResearchBench:在复杂科学文献发现上评测AI智能体
AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery
摘要
得益于AI智能体的发展,自主科学研究获得了显著推进。这一过程中的关键一步是找到合适的科学文献,无论是为研究问题探索已有知识,还是为验证假设、支撑论断获取证据。为评估AI智能体驱动这一过程的能力,我们提出AutoResearchBench,一个专门面向自主科学文献发现的基准。AutoResearchBench由两类互补任务构成:(1) Deep Research,要求通过渐进式多步探查追查到特定目标论文;(2) Wide Research,要求全面收集满足给定条件的一组论文。与以往的智能体网页浏览基准相比,AutoResearchBench在三个维度上独树一帜:研究导向,要求深入理解科学概念;聚焦文献,要求细粒度利用细节信息;开放式,涉及数量未知的合格论文,因而全程需要审慎的推理与搜索。这些特性使AutoResearchBench格外适合评估自主研究能力,同时也极具挑战性。即便是最强大的LLM,尽管已在BrowseComp等通用智能体网页浏览基准上大体攻克,在Deep Research上的准确率也仅9.39%,在Wide Research上的IoU仅9.31%,而许多其他强基线低于5%。我们公开发布数据集与评估流水线,以促进该方向的后续研究。我们在 https://github.com/CherYou/AutoResearchBench 公开发布数据集、评估流水线与代码。
