论文
BioStudyBench:评测 Agent 对知识截止后生物研究的分析
BioStudyBench: Evaluating Agents on Post-Cutoff Biomedical Studies
摘要
我们使用公共数据评估 AI 智能体是否可以与已发表的生物医学研究报告的结果相匹配。现有的评估并没有始终如一地将分析与先验知识或已发布答案的检索分开。我们引入了 BioStudyBench,这是 25 项长期分析任务的基准,这些任务取自 2026 年 7 月至 9 月首次发表的研究,在我们评估的模型的开发人员报告的知识截止之后,从 404,019 条 PubMed 记录中半自动筛选出来。在每项任务中,智能体都会收到一个中立的研究问题,但没有数据文件,因此它必须查找并下载相关的公共数据,通过仅返回截止日期之前的记录的工具搜索文献,并通过数据分析报告结果。为了衡量对现有知识的增益,我们在访问和不访问数据和工具的情况下运行每项任务。在八个模型中,与无数据基线相比,访问数据和工具使通过率平均提高了 47 个百分点。不同尺寸的 开放权重 模型都落后于封闭重量模型,最好的 开放权重 模型通过了 81.3% 的任务,而最佳封闭重量模型则为 94.7%。