论文

通过生成预训练和测试时计算扩展原子蛋白质结合剂设计

Scaling Atomistic Protein Binder Design with Generative Pretraining and Test-Time Compute

应用与实践科学研究

摘要

蛋白质相互作用建模是蛋白质设计的核心,机器学习已经改变了蛋白质设计,并应用于药物发现及其他领域。在这种情况下,基于结构的从头结合剂设计被视为条件生成模型或通过结构预测器进行序列优化(“幻觉”)。我们认为这是一种错误的二分法,并提出了 Proteina-Complexa,一种统一两种范式的新颖的完全原子结合剂生成方法。我们扩展了最近基于流的潜在蛋白质生成架构,并利用单体计算预测蛋白质结构的域-域相互作用来构建 Teddymer,这是一个用于预训练的合成结合物-目标对的新大规模数据集。与高质量的实验多聚体相结合,可以训练强大的基础模型。然后,我们使用这种生成先验进行推理时间优化,统一以前不同的生成方法和幻觉方法的优点。 Proteina-Complexa 在计算活页夹设计基准方面树立了新的技术水平:它比现有的生成方法提供了明显更高的计算机成功率,并且我们新颖的测试时优化策略在标准化计算预算下大大优于以前的幻觉方法。我们还展示了界面氢键优化、折叠类引导的结合剂生成以及小分子靶标和酶设计任务的扩展,再次超越了先前的方法。代码、模型和新数据将公开发布。