论文

PIT-GCL:使用拓扑图对比学习的蛋白质相互作用

PIT-GCL: Protein Interaction using Topological Graph Contrastive Learning

应用与实践科学研究

摘要

蛋白质结合预测对于靶标识别、治疗性粘合剂设计和大规模筛选至关重要,但仍然具有挑战性,因为结合取决于序列、三维几何形状和整体结构组织。最近的折叠模型(例如 AlphaFold3 和 Boltz-2)显着改进了结构预测,但它们的置信输出(pLDDT、pTM、ipTM)并不是专门为二元结合预测而设计的,并且专用的结构感知预测器通常需要在筛选规模上无法获得的结合复杂结构。我们引入了 PIT-GCL,一种双塔结构感知框架,它独立于其氨基酸序列、Cα 点云和全局持久同源描述符对每个蛋白质进行编码。每个塔将残差 ESM-2 嵌入与根据 Vietoris-Rips 过滤的 H0 和 H1 持久性景观计算出的拓扑摘要相结合,并使用结构感知 Transformer 处理生成的token,其中成对的 Cα 距离作为学习的注意力偏差输入。然后,双向交叉注意模块在两个每个蛋白质表示之间执行潜空间软对接,并使用组合的二元交叉熵和 NT-Xent 对比目标来训练模型。在三个二元相互作用预测基准(PPIRef 上的通用 PPI、STAG 上的 TCRpMHC 结合以及 PPB-Affinity 上的全链对)上,PIT-GCL 在我们的评估下优于通用 PPI 上基于代表性序列、结构感知和任务特定基线的性能,并且是 PPB-Affinity 上唯一高于随机水平的方法;在 TCR-pMHC 上,它在固定决策阈值上领先,但被任务特定序列模型超越。由于每个蛋白质在第一阶段都是独立编码的,因此可以预先计算其表示并在候选对之间重复使用,这便于大规模筛选。