论文

通过掩蔽基因表达进行有效的生物表征学习

Effective Biological Representation Learning by Masking Gene Expression

模型训练预训练

摘要

RNA 测序产生丰富多样的基因表达数据集,为细胞状态和功能提供令人信服的见解,在药物发现中有许多应用。由于固有的技术噪声和实验批次效应,对此类数据进行建模具有挑战性,许多现有的转录组基础模型 (FM) 相对于线性基线表现不佳就证明了这一点。这些结果提出了一个问题:深度表示学习是否比直接使用原始转录本计数具有明显的优势。我们的工作通过开发一种新的自我监督模型 TxFM 来探索这一点,重点是归纳表征学习评估。 TxFM 采用针对不同 RNA-seq 计数数据量身定制的屏蔽自动编码方法,我们的消融研究根据经验确定了强大传输性能所需的关键架构配置。此外,我们还策划了一个公共训练语料库 DiverseRNA-1.4M,并发现在这个策划的数据集上训练的 TxFM 产生的高保真基因表示,其性能优于在 100 倍以上的图集规模语料库上训练的 FM。总的来说,我们的结果表明归纳式自我监督学习是转录组学表示的一种可行的建模方法,提供了模型架构和训练数据管理的仔细综合。