论文

Proteo-R1:从头蛋白质设计的推理基础模型

Proteo-R1: Reasoning Foundation Models for De Novo Protein Design

应用与实践科学研究

摘要

从头蛋白质设计中的深度学习已经实现了原子级的保真度。然而,现有模型在很大程度上仍然是非故意的:它们直接合成分子几何形状,而没有明确推理哪些残基或相互作用在功能上是必需的。因此,设计决策与连续采样动态纠缠在一起,限制了生化知识的可解释性、可控性和系统重用。我们引入了 Proteo-R1,这是一种推理引导的蛋白质设计框架,它明确地将分子理解与几何生成分离。 Proteo-R1 采用双专家架构,其中多模式 大语言模型 (MLLM) 充当理解专家,分析蛋白质序列、结构和文本上下文,以识别控制结合和特异性的关键功能残基。然后,这些残基级决策作为硬约束传递给单独的基于扩散的生成专家,该专家在尊重固定交互锚的同时执行条件协同设计。这种因式分解反映了人类专家处理分子工程的方式:首先,推理关键的相互作用,然后根据这些约束优化几何形状。通过将推理操作为明确的残基级承诺而不是潜在的文本指导,Proteo-R1 实现了 LLM 推理与最先进的几何生成模型的稳定、可解释和模块化集成。代码、数据和演示可在 https://smiles724.github.io/r1/ 获取。