论文
通过正交投影解释蛋白质语言模型嵌入以进行蛋白质健康预测
Interpreting Protein Language Model Embeddings via Orthogonal Projection for Protein Fitness Prediction
摘要
最近,生物医学科学中越来越多地采用蛋白质语言模型(PLM)。它们的嵌入提供了丰富的蛋白质序列数字表示,可在包括蛋白质适应性预测在内的多个下游任务上实现最先进的性能。然而,PLM 嵌入无法直接解释,因此仍不清楚它们编码哪些功能。为了深入了解蛋白质的哪些生化特性正在驱动预测,我们利用正交投影技术,从嵌入中消除已知表格特征的线性效应,并将其扩展到高阶和相互作用效应。通过这种方式,我们消除了 PLM 嵌入中可解释的生化特征的影响。在一项消融研究中,我们表明这会导致仅在嵌入上训练以预测蛋白质适应性的下游分类器的性能下降。在额外的评估中,我们发现这些生化特征解释了该分类器预测中的很大一部分方差。因此,我们可以证明 PLM 嵌入编码与生化特性相关的模式,并量化它们对预测蛋白质适应性的贡献。这种计算效率高的方法并不限于这里考虑的特征或嵌入,并且可以很容易地转移到蛋白质适应性预测之外的问题设置。