论文
跨肽和靶标转换的肽-蛋白质亲和力预测基准
Benchmarking Peptide-Protein Affinity Prediction Across Peptide and Target Shifts
摘要
肽-蛋白质亲和力模型通常使用单个数据分割进行评估,从而模糊了它们是否在观察到的目标的测量值之间进行插值或概括肽或目标的变化。我们整合了定量肽-蛋白质结合数据的三个来源,以获得 11,349 个去重复对,并在肽相似性、目标内和排除目标分区下对 10 个肽表示、ESM-2 蛋白质嵌入和 6 个回归量进行了基准测试。在 60 个匹配的表示回归器配置中,平均检验 Spearman 相关性分别为 0.462、0.669 和 0.530。当排除确切的目标序列时,顶部配置从前两个设置中具有随机森林的 ECFP-16 计数指纹转变为具有额外树的 HELM-BERT。跨分区的表示-秩相关性范围为 -0.042 到 0.624,而回归量-秩相关性范围为 0.771 到 0.943。学习曲线表明,在监督有限的情况下,表征差异最大,并且随着训练数据的增加而缩小。 PeptideCLM-2 适配和简单的逐元素交互功能与测试协议下的冻结编码器和直接串联相比没有提供一致的增益。这些结论特定于汇集转换后的 Kd、Ki 和 IC50 测量值的数据集,并针对精确序列水平的排除目标。因此,肽-蛋白质亲和力基准应该将数据分区与预期用途保持一致,并共同评估数据规模、分子表示和下游学习者的影响。