论文

长程空间生物学的可验证基准测试

Verifiable Benchmarking of Long-Horizon Spatial Biology

智能体系统Agent任务评测长程任务评测

摘要

AI智能体在生物数据分析中日益有用,但现有基准大多测试宽泛的生物学知识、可执行的工作流或局部分析步骤,而非对空间测量的端到端科学推理。我们提出SpatialBench-Long,一个长程空间生物学基准,其中智能体必须在无指定方法的前提下,从原始或近原始数据与经校准的实验上下文中恢复生物学论断。SpatialBench-Long包含24项评估,覆盖原发胰腺导管腺癌(PDAC)、工程化胶质母细胞瘤类器官与体内肿瘤、Cas9谱系示踪的肺腺癌以及小鼠视神经衰老/干预系统,横跨CosMx、Visium、Xenium、多重错误校正荧光原位杂交(MERFISH)、单细胞RNA测序(scRNA-seq)、Slide-seq、Slide-tags、组织学与谱系记录数据。候选论断经复现、独立科学家审阅与轨迹检查加以固化。最终答案基于受控词表与符号进行确定性判分,并配有刻画关键分析卡点进展情况的评分细则。在SpatialBench-Long基准上,三个模型-测试框架组合以8/72次运行(11.1%)并列:Gemini 3.5 Flash / Pi终端编程框架、GPT-5.5 / Pi以及GPT-5.5 / OpenAI Codex。SpatialBench-Long检验的是智能体能否超越执行程序化分析,从复杂空间测量中得出准确的科学结论。