论文

蛋白质语言模型中的任务和数据集特定信息

Task- and dataset-specific information in protein language models

模型评测模型行为与机制分析

摘要

蛋白质语言模型 (PLM) 已将自然语言处理的最新进展转移到计算生物学。这些模型在大型蛋白质序列数据集上进行训练,广泛用于将氨基酸序列翻译成潜在空间嵌入,准备用于各种下游任务(DT)。一致认为,使用模型最后一层的嵌入,而模型的内部行为仍然知之甚少。我们分析了 15 个 DT 和 9 个数据集的 13 个 PLM,以评估中间 PLM 层嵌入的价值。我们对每一层的嵌入训练探针模型,比较它们的性能,并表明 PLM 的最后一层很少产生能够在下游任务中产生最佳结果的嵌入。此外,我们还确定了模型如何学习某个 DT 以及该 DT 与 预训练 目标之间的相似性之间的联系。例如,对于残留级下游任务,我们观察到几乎所有 PLM 层的性能都在稳步提高,我们将其归因于它们与大多数 PLM 的 预训练 目标的相似性。为了让社区能够利用我们的发现,我们提供了 PLMSommelier,这是一个 Python 包,可以自动识别给定 DT 的最佳 PLM 层,准确率约为 98%,并仅使用早期层到性能最佳层创建截断模型。这将帮助用户在推理过程中节省时间和内存,并产生更好的预测性能。