论文
AssayBench:LLM 和代理的检测级虚拟细胞基准
AssayBench: An Assay-Level Virtual Cell Benchmark for LLMs and Agents
摘要
机器学习和大规模生物数据收集的最新进展重振了构建虚拟细胞的前景,虚拟细胞是一种可以加速生物发现的细胞行为计算模型。这一愿景最引人注目的承诺之一是能够在计算机表型筛选中执行,其中模型可以预测细胞扰动在不可见的生物环境中的影响。该任务将异构文本输入与不同表型输出相结合,使其特别适合 LLM 和代理系统。然而,目前这项任务还没有标准基准,因为现有的工作重点是较窄的分子读数,这些读数仅与驱动许多现实世界药物发现工作流程的表型终点间接相关。在这项工作中,我们提出了 AssayBench,这是表型筛选预测的基准,由 1,920 个公开可用的 CRISPR 筛选构建,涵盖五大类细胞表型。我们将筛选预测任务制定为每个筛选的基因排名预测,并引入调整后的 nDCG,这是一种用于比较异质测定性能的连续指标。我们的广泛评估表明,现有方法距离经验估计的性能上限还很远,零样本通才 LLM 优于生物学特定的 LLM 和可训练基线。 微调、集成和提示优化等优化技术可以进一步提高 LLM 在此任务上的性能。总体而言,AssayBench 提供了一个实用的测试平台,用于测量计算机表型筛选以及更广泛的虚拟细胞模型的进展。