论文

蛋白质语言模型中的残基水平归因不能恢复过敏原表位

Residue-Level Attributions in Protein Language Models Do Not Recover Allergen Epitopes

模型评测评测方法与指标

摘要

深度过敏原性分类器越来越多地用于新型食品的安全筛选,最近的蛋白质语言模型大大改进了蛋白质水平的过敏原性预测。然而,他们的解释是否捕获了具有生物学意义的信息仍不清楚。我们引入了基于表位的残留水平基准,用于定量评估蛋白质过敏性模型中的归因 忠实性。在冷冻 ESM-2、多任务 ESM-2 和 DeepPlantAllergy 中,蛋白质水平分类是稳健的,但分类头解释信号在与 AUROC、AUPRC 和 Precision@k 中注释表位的残基水平比对中并未显着超出随机范围。积分梯度确定了对模型具有重要功能但不与注释表位重叠的残基。饱和诱变进一步表明分类器可能依赖于物理化学和组成序列特征而不是表位特异性机制。因此,未经定量验证,残留水平重要性信号不应被解释为安全筛查或低过敏原设计的免疫学解释。可用代码:https://github.com/Jeffateth/XAllergen2.0-paper