论文
LEMON-ZEST:用于高效蛋白质语言建模的进化信息标记化
LEMON-ZEST: Evolution-Informed Tokenization for Efficient Protein Language Modeling
摘要
蛋白质语言模型(PLM)遵循在基于序列和基于结构的任务的自然语言处理中建立的缩放法则,取得了显着的进展,但标记化的潜力仍未得到充分开发。与人类语言不同,尽管存在广泛的序列变异,但蛋白质仍保留结构,这是一种属性标准标记化策略从根本上无法捕捉到的。我们引入了 ZEST(序列特征的分区编码),这是一种源自多个序列比对的保守区域的进化词汇表。 ZEST 允许在标记化阶段直接嵌入域级生物先验,而不是通过规模隐式学习它们。 ZEST 本身将序列压缩为平均标记长度为 4 个残基,使我们的模型能够在标准的 1024 个标记上下文窗口中处理 4,000 个残基。在此基础上,我们提出了 LEMON(自然界分子排序的分层提取),这是一种基于 200M 参数序列的紧凑模型,用于检测在单个 H100 GPU 上训练一周的蛋白质序列之间的远程同源性。尽管尺寸适中,LEMON 的性能优于从 600M 到 3B 参数的最先进模型。我们的结果表明,基于进化的标记化可以替代大规模参数缩放,为高效、基于生物学的蛋白质表示学习开辟了新方向。所有代码、模型权重和结果均在 MIT 许可下公开可用。