论文

JEPA-DNA:通过联合嵌入预测架构为基因组基础模型奠基

JEPA-DNA: Grounding Genomic Foundation Models through Joint-Embedding Predictive Architectures

模型训练预训练

摘要

基因组基础模型 (GFM) 在很大程度上依赖于掩码语言模型 (MLM) 或下一个token预测 (NTP) 来学习生命语言。虽然这些范式擅长捕获局部基因组语法和细粒度基序模式,但它们通常无法捕获更广泛的功能背景,从而导致缺乏全局生物学视角的表示。我们引入了 JEPA-DNA,这是一种新颖的预训练框架,它将联合嵌入预测架构 (JEPA) 与传统的生成目标集成在一起。 JEPA-DNA 通过监督 CLS token,将token级恢复与潜在空间中的预测目标相结合,引入了潜在接地。这迫使模型预测屏蔽基因组片段的高级功能嵌入,而不是仅仅关注单个核苷酸。 JEPA-DNA 扩展了 NTP 和 MLM 范例,可以作为独立的从头开始的目标进行部署,也可以作为现有 GFM 的持续预训练增强进行部署。我们对各种基因组基准的评估表明,与仅生成基线相比,JEPA-DNA 在监督和零样本任务中始终具有卓越的性能。通过提供更强大且具有生物学基础的表示,JEPA-DNA 为基础模型提供了一条可扩展的路径,这些模型不仅理解基因组字母表,而且还理解序列的底层功能逻辑。

JEPA-DNA:通过联合嵌入预测架构为基因组基础模型奠基
图1:JEPA-DNA架构。