论文

蛋白质基础模型健康预测的通用工具

A General Harness for Protein Foundation Model Fitness Prediction

上下文与知识检索增强

摘要

准确的适应度预测对于蛋白质工程和理解序列功能关系至关重要。随着深度学习的进步,蛋白质基础模型(PFM)已广泛用于这项任务。然而,最近的分析表明,这些模型共享反映其训练语料库的偏好,而不可靠的输入可能会进一步扭曲适应度预测。特定家族的进化证据和结构背景可以通过提供对模型分数的补充约束来帮助解决这些限制,激发 VenusREM-Harness (VRH),这是一种通用的、与模型无关的、免训练的检索增强突变Harness。它根据模型不确定性将冻结模型分数与多重序列比对 (MSA) 证据融合,然后根据结构置信度和溶剂暴露应用门控背景校正和分数收缩。在来自 ProteinGym、VenusMutHub 和新策划的病毒基准 VenusViroHub 的 1,211 项检测和 310 万个测量变体中,所有 71 种配置将所有 3 个基准的 Spearman 相关性平均提高了 0.073,在 5 个指标上都有广泛的收益。扩展分析将检索增益与模型 MSA 偏好差异联系起来,评估域级增益和免疫逃逸案例,并量化计算加速。 VenusREM2 采用 VRH 构建,在所有功能、分类单元、MSA 深度和突变深度类别中排名第一,ProteinGym Average Spearman 为 0.556,比之前的最佳值高出 0.038。