论文

中心法则 Transformer III:跨 DNA、RNA 和蛋白质的可解释 AI

Central Dogma Transformer III: Interpretable AI Across DNA, RNA, and Protein

应用与实践科学研究

摘要

生物人工智能模型越来越多地预测复杂的细胞反应,但它们学到的表征仍然与它们想要捕获的分子过程脱节。我们提出了 CDT-III,它将面向机制的 AI 扩展到完整的中心法则:DNA、RNA 和蛋白质。其两阶段 Virtual Cell Embedder 架构反映了细胞的空间划分:VCE-N 模拟细胞核中的转录,VCE-C 模拟细胞质中的翻译。在五个保留基因上,CDT-III 实现了每个基因 RNA r=0.843 和蛋白质 r=0.969。添加蛋白质预测可提高 RNA 性能(r=0.804 至 0.843),证明下游任务规范了上游表示。蛋白质监督提高了 DNA 水平的可解释性,将 CTCF 富集度提高了 30%。对实验测量的 mRNA 和蛋白质反应的分析表明,大多数具有可观察到的 mRNA 变化的基因显示出相反的蛋白质水平变化(|log2FC|>0.01 时为 66.7%,|log2FC|>0.02 时上升至 87.5%),暴露了仅 RNA 扰动模型的根本局限性。尽管存在这种普遍的方向不一致,CDT-III 正确预测了 mRNA 和蛋白质反应。该模型应用于近似阿仑单抗的计算机 CD52 敲低,正确预测 29/29 的蛋白质变化,并重新发现 7 种已知临床副作用中的 5 种,而无需临床数据。基于梯度的副作用分析仅需要未受干扰的基线数据 (r=0.939),无需新实验即可筛选所有 2,361 个基因。