论文

寻找丢失的 DNA 序列预训练

In Search of Lost DNA Sequence Pretraining

模型训练预训练

摘要

DNA 序列编码是基因功能预测、蛋白质合成和各种下游生物学任务的基础。尽管大规模DNA序列预训练取得了实质性进展,但现有研究绝大多数强调预训练规模和定制下游评估数据集,而忽略了预训练范式的一些重要组成部分。在本文中,我们揭示了 DNA 预训练中三个关键但迄今为止被忽视的问题:不合适的下游数据集、邻居掩蔽策略的固有缺陷以及缺乏对词汇的详细讨论。因此,我们进行了全面的调查并提出了原则性指南,包括评估数据集的选择标准、指导任务设计和深入的词汇分析。大量的实验验证了我们发现的问题的重要性,并支持了我们建议背后的基本原理。最后,我们引入了一个标准化测试平台,可以对 DNA 预训练方法进行可重复且严格的基准测试,以推进基因组基础模型的开发。