论文

发现、伪造、修改:审计从源代码到代理发现的单元模型中的预测贡献的输入使用声明

Discover, Falsify, Revise: Auditing Input-Use Claims from Source Code to Predictive Contribution in Agent-Discovered Cell Models

模型评测评测方法与指标

摘要

人工智能虚拟细胞旨在预测细胞对特定干预措施的反应,但仅提供预测性能并不能建立对所提供的扰动信息的使用。这种预测与声明之间的差距在代理模型发现中很重要,其中语言模型代理使用基于分数的反馈生成和修改预测变量。我们引入了 CELLAUDIT,它通过询问输入是否可以进入引用的计算、拟合预测是否依赖于它以及这种依赖性是否改善了观察到的响应的预测来审核输入使用声明。在配对的形态学转录组扰动基准 (BBBC047) 上,代理选择的预测器获得平均保留全局皮尔逊相关系数 (PCC) 0.3153,但对化合物替换保持不变;仅控制剖面的预测器达到 0.3142。源检查识别出被单键值关注阻塞的复合查询路径,并且在使用不相交的控制井重新拟合后,不变性仍然存在。在对两个相关任务中的 48 名候选者进行的分层审核中,在两个保留折叠上的复合替换下,47 个改变了预测,但只有 20 个显示两个折叠上的间隔均大于零的目标损失增益。在 BBBC047 上,伪造引导的修正恢复了正的平均复合贡献,同时保留了仅控制配置文件基线的收益。在匹配的 sci-Plex 搜索中,尽管配对间隔跨度为零,但经过审计丰富的反馈会在五个轨迹上产生更高的保留性能和更大的平均化合物和剂量贡献。在独立获得的队列上重新调整固定设计表明,预测概括并不意味着输入使用声明的概括:剂量贡献持续存在,而对化合物同一性的支持则不然。 CELLAUDIT 在代理模型发现中添加了一个伪造层,从生成-评分-修改转向发现-伪造-修改。