论文

EpiBench:AI智能体表观基因组分析的可验证评估

EpiBench: Verifiable Evaluation of AI Agents on Epigenomics Analysis

智能体系统Agent任务评测

摘要

我们推出 EpiBench,这是一种可验证的短视野表观基因组学分析基准。 EpiBench 评估代理是否可以根据实际工作流程状态做出明确定义的分析决策,并返回确定性的可分级答案。该基准包括 CUT\&Tag/CUT\&RUN、ATAC-seq、ChIP-seq 和 DNA 甲基化工作流程的 106 项评估。在来自 16 个模型Harness对的 5,088 个有效轨迹中,没有一个系统通过了大多数尝试:GPT-5.5 / Pi 以 45.0\% 领先(143/318 次尝试;95\% 置信区间 (CI),36.3--53.7),其次是 GPT-5.5 / OpenAI Codex,为 39.9\%(127/318 次尝试;95\% 置信区间 (CI),36.3--53.7)。 95\% CI, 31.6--48.3)。 Claude Opus 4.8 Max / Pi 和 GPT-5.4 / Pi 均通过了 39.0\%(124/318 次尝试;95\% CI,分别为 30.2--47.8 和 31.0--47.0)。不同检测类型的性能各不相同,许多失败的运行仍然包含部分正确答案。智能体经常找到正确的文件并计算出有用的中间结果,但当任务需要更深入的、针对具体分析的科学判断时,就会失败。