论文

LC-SEPLM:用于仅序列蛋白质表示学习的远程接触监督适应

LC-SEPLM: long-range contact-supervised adaptation for sequence-only protein representation learning

模型训练监督微调与指令调优参数高效训练

摘要

蛋白质语言模型学习可转移的序列表示。然而,由于它们主要模拟沿氨基酸序列的上下文依赖性,因此它们的训练目标并没有明确限制模型学习折叠后形成的三维残基接触。在这里,我们介绍 LC-SEPLM(远程接触监督 ESM 蛋白质语言模型),它采用 LoRA 和远程残基对接触监督来调整 ESM2,同时保留仅序列下游推理。特定对的查询使用整个序列的交叉注意力来提取与远程空间接触相关的全局序列上下文。为了让模型了解不同的结构信息,我们在 500,000 个 AlphaFold Swiss-Prot 蛋白上训练了 LC-SEPLM。在下游评估中,LC-SEPLM 相对于 ESM2 改进了所有八个蛋白质水平任务。最大的增益出现在远程同源识别中,其中宏 F1 从 0.6122 增加到 0.6769(+0.0647,即 6.47 个百分点)。在官方 ESM-S EC 基准测试中,LC-SEPLM 的性能也优于 ESM-S,最大绝对增益为 0.1771。这些结果支持残基对接触监督作为将结构信息引入蛋白质序列表示的有界途径,同时保留仅序列推断。