论文

合理性不是预测:基于 LLM 的细胞扰动推理的对比证据

Plausibility Is Not Prediction: Contrastive Evidence for LLM-Based Cellular Perturbation Reasoning

上下文与知识检索增强

摘要

扰动实验对于理解细胞机制至关重要,但仍然成本高昂且稀疏,从而激发了对未观察条件下基因表达反应的预测。最近一个有前途的方向利用 大语言模型 (LLM) 作为“虚拟细胞”模拟器——使用逐步的、基于知识的机械推理来推断差异表达——指向一种超越纯粹数据驱动方法的可解释的、知识驱动的范式。然而,我们发现合理性并不是预测:尽管产生了生物学上合理的解释,但这些方法无法捕获扰动的特定效应:系统性地高估差异表达,在总体评估中通常表现不佳于简单的基因频率基线,并在每个基因水平上崩溃到机会水平的表现。这揭示了对内在基因反应倾向的依赖,而不是真正的扰动推理。我们将这种失败追溯到证据的呈现方式:现有方法单独评估扰动基因对,而没有揭示相关扰动对同一基因的影响有何不同。为了解决这个限制,我们引入了 CORE(关系证据对比组织),它通过将证据组织为相关扰动的积极和消极结果,将预测重新构建为比较任务。使用生物医学知识图进行证据检索,CORE 改进了校准,并在基于 LLM 和非 LLM 设置中显着提高了特定于扰动的预测:例如,在药物扰动数据上,CORE-Reasoning 将 Qwen3.5-9B 聚合指标提高了 28.6%,而在通用扰动数据上,CORE-Voting 提高了每个基因的宏观预测四种细胞系的 AUROC 平均值从偶然变为 0.703。这凸显了对比证据组织对于可靠的基于 LLM 的扰动推理至关重要