论文
AgentPLM:具有推理增广解码的智能体蛋白质语言模型
AgentPLM: Agentic Protein Language Models with Reasoning-Augmented Decoding for Protein Sequence Design
摘要
蛋白质语言模型 (PLM) 是被动的预言机:它们在单次前向传递中生成序列,没有机制在候选违反热力学或结构约束时咨询外部生物物理反馈或重定向生成。我们引入了 AgentPLM,它通过为预先训练的 PLM 配备 i) 推理增强解码 (RAD) 来解决这个问题,它将自回归生成与工具调用(ESMFold、FoldX、AutoDock Vina)交错,以及 ii) 对比代理策略优化 (CAPO),这是直接偏好优化的轨迹级扩展,可以端到端地训练策略来学习预言机反馈何时提供信息而不仅仅是模仿高适应度序列。我们在基准任务上评估 AgentPLM,这些任务涵盖从头酶设计、抗体优化、热稳定性、PPI 接口设计以及使用标准化 Oracle API 和受控序列身份分割的零样本适应度预测。 AgentPLM 实现了最先进的结果,抗体命中率比最强的被动基线提高了 10%,提供了在线纠错的机械证据,无需显式回溯。
