论文

黑暗调节组:将可预测性与基因组基础模型中的调节分开

The Dark Regulome: Disentangling Predictability from Regulation in Genomic Foundation Models

模型评测模型行为与机制分析

摘要

高级别神经胶质瘤通过神经元的功能性突触整合到神经回路中,提出了哪些非编码元件塑造肿瘤细胞中突触基因表达的问题。跨暗基因组编写的调控程序,我们称之为 $\textit{dark regulome}$,是探测的天然底物,序列基础模型通过计算机诱变 (ISM) 提供了零样本途径;然而,基于可能性的评分与局部序列可预测性同义反复地耦合在一起,使得监管解释不确定。通过三个结构不同的基础模型(Caduceus-Ph、HyenaDNA、Enformer)和 92 个神经胶质瘤相关基因座的 30,448 个暗基因组元件,我们引入了残差和排列诊断,将可预测性驱动的 RIS 方差与调节驱动的 RIS 方差区分开来。尖锐的 10kb 近端监管范围在我们应用的每个控制中都存在,但 LM 派生的元素类层次结构却不然:六特征线性基线与 Caduceus 前十分位成员资格 (AUC $= 0.985$) 相匹配。跨架构分解将序列可预测性层(两种语言模型对长期良好预测的转座元素进行共同排名)与监管输出层(Enformer 单独保留残余 cCRE 判别信号)分开,两个前 100 个列表之间的重叠实际上为零。然后,保守性、大脑 cis-eQTL 和 STRING-PPI 交叉检查确定了哪些生物学能够幸存:每个模型在所有三个模型中的前 100 个元素都富集了 $3.3\times$,用于匹配大脑 eQTL ($p_\mathrm{emp} < 5\times 10^{-3}$),而诱人的转座元件调节层和引人注目的 NRXN1+NLGN1 蛋白质对收敛都失败了一旦构建了这些测试,就可以进行适当的排列测试。我们将诊断作为任何基于 ISM 的监管研究的通用方法工具。