论文

CausalBind:稀疏基础模型概念交互改善蛋白分子筛选

CausalBind: Causal Modeling and Learning for Protein-Molecule Virtual Screening

模型架构混合架构

摘要

蛋白质分子虚拟筛选越来越多地被视为共享嵌入空间中的表示学习问题。现有方法依赖于密集的整体比对,将不变的结合决定因素与令人讨厌的相关性纠缠在一起,并限制向新目标的转移。人们注意到,蛋白质-分子系统中的结合涉及稀疏的跨模态相互作用:结合由小的接触界面和一些决定性的局部相互作用(例如氢键、疏水接触和盐桥)控制,而不是由蛋白质和分子的整体结构控制。我们假设发现和利用稀疏交互模式对于 训练 数据之外的泛化至关重要,因为这些模式是可重用的,并且有望提高不同场景的性能。在本文中,我们的目标是识别和利用稀疏交互模式,并验证我们的假设。由于 训练 数据仅包含观察到的结合对,因此我们通过 Heckman 式选择下的 V 结构因果模型将其形式化,并建立了三个理论结果:(i)如果没有适当的稀疏性约束,则无法识别相互作用的蛋白质和分子的潜在概念; (ii) 这些概念及其稀疏相互作用在结构稀疏条件下是可逐成分识别的; (iii) 这些条件的 低秩 松弛产生概念和交互的子空间可识别性。受这些原则的启发,我们提出了具有三种实现变体的 CausalBind。对 DUD-E 和 LIT-PCBA 基准的大量实验表明,所有变体的性能始终优于强大的检索基线,其中 LIT-PCBA 早期富集的收益最大,并进一步推广到目标级和 脚手架 级的分布外分割。代码可在 https://github.com/lokali/CausalBind. 获取

CausalBind:稀疏基础模型概念交互改善蛋白分子筛选:论文原图
图 1:密集比对与稀疏结合。 (a) 整体密集排列。现有的基于检索的虚拟筛选方法将每个蛋白质表面特征与共享嵌入空间中的每个分子特征进行比较;这种“全表面”排列将结合相关信号与令人讨厌的相关性纠缠在一起。 (b) 生物学启发的稀疏结合。蛋白质-分子结合由小接触界面和一些关键的局部相互作用(例如氢键、疏水接触、盐桥和 $\pi$ 堆积)控制,它们共同构成了大部分的结合亲和力。