论文

我们可以相信发行中的成功吗?锁定评估揭示了 CRISPRi 扰动预测中的传输失败和采样深度纠缠

Can We Trust In-Distribution Success? Locked Evaluation Reveals Transfer Failure and Sampling-Depth Entanglement in CRISPRi Perturbation Prediction

模型评测鲁棒性、公平性与可信度评测

摘要

当领域内的基准测试成功无法承受分布变化时,或者当基准端点与设计因素纠缠在一起时,人工智能评估可能会支持错误的推论。我们在 CRISPRi 扰动效应预测中研究这个问题,在锁定的预注册协议下评估冻结的 Geneformer 表示:在测试评估之前冻结头和模型选择;该协议要求在最终揭盲之前保留外部结果标签;分析管理决策在其管理评估之前就已经确定。在虚拟细胞挑战 (VCC) 的分布中,冻结表示携带超出维度匹配随机特征控制的可测量预测信息(Delta R^2 = +0.1645,95% CI [+0.1375,+0.1920]),满足解释传输之前所​​需的预注册信息门。然后,它在两个外部屏幕上的零次传输失败(Spearman rho = -0.139 和 -0.267),位于每个外部屏幕上的控件下方。添加预定义的幅度块改善了外部表示(Delta rho = +0.032 和 +0.143),但在冻结的主头下,并不能挽救传输:两者都保持负值。预先注册的、计数调整的最大响应次级与两个屏幕上的结果呈正相关;我们将其报告为相关和次要信号,而不是恢复的幅度信号。最后,VCC 端点与样本大小密切相关:仅计数线性模型达到 R^2 = +0.4325,而四个量级标量则达到 +0.2589;将这些标量添加到细胞计数中仅将 R^2 提高 +0.0017,因此大部分聚合幅度信号与细胞计数重叠。本案例研究展示了锁定评估、协调测量终点以及将主要证据与次要证据分开如何改变人工智能基准支持的推论。