论文

RAGenome:将基于检索的基因组语言模型扩展到长上下文

RAGenome: Scaling Retrieval-Based Genomic Language Models to Long Contexts

模型训练上下文与知识预训练检索增强

摘要

基因组拥有控制细胞生物学特性的蓝图。因此,增进我们对基因组功能的了解对于更广泛地了解生物学和持续生物医学进步至关重要。自然语言和蛋白质序列上的大型语言模型的成功激发了基因组数据上的类似努力。然而,标准基因组语言模型(gLM)通常需要极大的计算资源,并且在一些下游任务上仍然落后于传统方法。最近,基于 MSA 的预训练被提出作为一种有效的替代方案,但现有模型仅限于短输入上下文,限制了它们在短程任务中的使用,例如变量效应预测。在这项工作中,我们提出了 RAGenome,这是第一个基于检索的 gLM,可将预训练扩展到更长的上下文(比现有的基于 MSA 的 gLM 长 100 倍\倍),使其能够捕获跨物种进化关系和物种内更长期的相互作用。经过 100 种脊椎动物的全基因组比对培训,RAGenome 显着提高了基于 MSA 的 gLM 的远程能力,将基因查找性能从 0.45 提高到 0.60,同时在纯粹基于进化的任务(如优先考虑致病变异)上保持竞争力。 RAGenome 以训练成本的一小部分提供有竞争力的 gLM 性能,将进化建模和远程功能统一在一个灵活的、可扩展的框架内。代码可在 https://github.com/PanosAntoniadis/RAGenome. 获取