论文

通过可微图划分对蛋白质语言模型表示的结构解释

Structural Interpretations of Protein Language Model Representations via Differentiable Graph Partitioning

模型评测模型行为与机制分析

摘要

ESM-2 等蛋白质语言模型学习丰富的残基表示,在蛋白质功能预测方面实现了强大的性能,但它们的特征仍然难以解释,因为结构 $\&$ 进化信号被编码在密集的潜在空间中。我们提出了一个即插即用的框架,将 ESM-2 表示投影到蛋白质接触图 $\&$ 应用 $\textbf{SoftBlobGIN}$(一种具有可微 Gumbel-softmax 子结构池的轻量级图同构网络)来执行结构感知消息传递 $\&$ 学习下游预测任务的粗略功能子结构。在酶分类中,SoftBlobGIN 的准确率达到 92.8% $\&$ 0.898 Macro-F1。与单独蛋白质语言模型的事后分析不同,我们的方法产生直接可审计的结构解释:GNNExplainer 恢复具有生物学意义的活性位点残基、空间局部功能簇、$\&$ 催化接触模式。在结合位点检测方面,SoftBlobGIN 使用 ESM-2 线性探针将残基 AUROC 从 0.885提高到 0.983,这表明这些结构解释不能仅从语言模型特征中恢复。学习的斑点分区通过自动将残基分组为功能子结构来提供额外的可解释性层,包含注释的活性位点残基的斑点比其他斑点($ρ{=}0.339$,$p{=}0.009$)显示出 $1.85倍$ 的重要性,而无需任何活性位点监督。我们的框架不需要重新训练语言模型,仅添加 $\sim$1.1M 参数,$\&$ 在 ProteinShake 任务中泛化,在基因本体预测上实现 $F_{\max}$ 为 $0.733$,在结合位点检测上实现 $\&$ AUROC 为 $0.969$。我们将其定位为蛋白质语言模型的可解释结构伴侣,使它们的预测更加透明、可审计。