论文

通过嵌入匹配提炼基因组模型以实现高效 mRNA 表示学习

Distilling Genomic Models for Efficient mRNA Representation Learning via Embedding Matching

摘要

大型基因组基础模型最近取得了显着的成果和体内翻译能力。然而,这些模型很快就会增长到超过数十亿个参数,并且在计算有限时运行成本高昂。为了克服这一挑战,我们提出了一个 蒸馏 框架,用于将 mRNA 表示从最先进的基因组基础模型转移到专门用于 mRNA 序列的小得多的模型中,将大小减少了 200 倍。嵌入级 蒸馏 比基于 logits 的方法效果更好,我们发现后者不稳定。 mRNA-bench 的基准测试表明,经过蒸馏的模型在同等大小的模型中实现了最先进的性能,并且可以与 mRNA 相关任务的更大架构竞争。我们的结果强调基于嵌入的 mRNA 序列 蒸馏 作为生物基础模型的有效训练策略。这使得基因组学中类似的高效且可扩展的序列建模成为可能,特别是当大型模型在计算上具有挑战性或不可行时。