论文

ProteinJEPA:潜在预测改善蛋白质语言模型预训练

ProteinJEPA: Latent prediction improves protein language model pretraining

模型训练预训练

摘要

蛋白质语言模型主要使用掩码语言模型 (MLM) 进行训练,该模型可预测掩码氨基酸身份。联合嵌入预测架构(JEPA)改为预测潜在表示,但尚未应用于蛋白质。 ProteinJEPA 通过余弦损失来补充 MLM,用于预测给定未屏蔽序列的教师的半深度隐藏状态。在 19 项任务中,使用 35M 和 150M 参数的 ESM2 以及三个预训练种子,MLM+JEPA 在 114 次比较中的 78 次和 76 次比较中优于计算匹配和仅步骤匹配的 MLM 继续训练(14 次损失,22 次平局)。在结构和同源敏感任务上,计算匹配增益中位数为 +0.0106,而其他任务的计算匹配增益为 +0.0041,其中 SCOPe-40 检索和远程同源性领先,Recall@1 提高了 6.1 个百分点,准确度提高了 2.7 个百分点。随着模型大小从 8M 增加到 150M,这些任务的收益也会增加。与现成的检查点相比,MLM+JEPA 在 114 次比较中赢得了 81 次(中位数 $+0.0068$),但没有改善 MLM 损失。在随机初始化中,增益较小,并且在种子之间复制不一致 ($p{=}0.059$)。同样的方法改进了因果 ProGen3 模型,在 16 个任务中的 12 个上击败了计算匹配的下一个标记预测控制。消融表明,余弦损失优于均方误差,而添加较浅的目标会消除大部分任务增益。仅 JEPA 训练会导致下游性能崩溃:潜在预测补充了 MLM,而不是取代它。代码:https://anonymous.4open.science/r/protJepa-FF24