论文
BioSecBench-Surveillance:病原体基因组监测中AI智能体的可验证基准
BioSecBench-Surveillance: A Verifiable Benchmark for AI Agents in Pathogen Genomic Surveillance
摘要
随着病原体基因组监测规模化,瓶颈正从数据生成转向分析。我们提出BioSecBench-Surveillance,一个含100项评估的可验证基准,检验AI智能体能否从原始测序数据与监测上下文推断出正确的分析管线。每项评估只给智能体人类分析师会拥有的数据与上下文,然后确定性地为其结构化答案评分。任务横跨七个类别——从分类学到基因工程检测——覆盖多样样本类型与测序技术。在十六个模型—治控对、3,962次可评分尝试中,最强配置也只清除了约一半:Opus 4.8+PI以50.2%领先(83项评估的95% CI 40.1–60.3),与GPT-5.5+Codex的50.2%(95% CI 40.8–59.6)持平;其后是Opus 4.7+PI的49.6%(95% CI 40.0–59.2)与Sonnet 4.6+PI的48.6%(95% CI 38.9–58.3)。即使智能体调用了正确的工作流,错误也来自周边选择——应用哪个参考、阈值、过滤器与标准化。BioSecBench-Surveillance为“下一场疫情到来时能否信任智能体执行基因组监测”提供度量标准。