论文
无实验读出能预测表型活性吗?
Can phenotypic activity be predicted without experimental readouts?
摘要
分子编码器在配对分子形态学数据(例如 CLOOME 和 CellCLIP)上进行对比预训练,已被提议作为用于表型预测的廉价 代理模型,从而避免运行细胞绘制测定的需要。我们根据一个协议评估了这些分子编码器的这一想法,该协议旨在控制两个可能夸大表观性能的混杂因素:编码器自身预训练边界的泄漏,以及表型活性和细胞毒性之间的相关性。在两个不同的细胞绘画屏幕上测试六种表示,包括匹配 CLOOME 输入和层数的非预训练 MLP 控制,我们发现,一旦控制了这些混杂因素,预训练的分子编码器就不会比普通的物理化学描述符表现出明显的优势,而且毒性通常比跨表示的表型活动更容易预测。我们的结果表明,在表型预训练编码器被信任为用于表型药物发现的 代理模型 之前,泄漏感知、混杂控制评估应该成为标准做法。