论文

从基准到基准:智能体能否在现实世界的药物发现中幸存下来?

From Benchmark to Bench: Can Agents Survive Real-World Drug Discovery?

应用与实践科学研究

摘要

Agentic系统越来越多地协调分子设计工具,但尚不清楚堆栈的哪一层限制了实际项目的结果。我们开发了 MAGI,一个开放式模块化智能体,它可以编写目标、启动和监控优化、解释结构-活动关系,并相应地修改其策略。 MAGI 直接通过LLM或委托给 REINVENT 4 生成分子,评分服务可在通用合约后互换。我们在三个制药公司的九项回顾性先导化合物优化活动中对其进行了测试,并在固定的时间截止条件下重播。两条路线都产生了有效的结构:LLM提案更接近当地化学,并在更少的操作中达到了相当或更高的主要活性,而 REINVENT 则探索了更广泛的化学空间。一场活动是否达到其目标取决于预测模型,而不是生成路线:达到的目标取决于模型对所提出的化学反应的准确性,一旦化学反应超出了模型的适用范围,就会下降。另外,一项盲法评估询问 MAGI 的输出是否可以通过专家工作:化学家无法区分Agentic提案和留出化合物,并判断 SAR 推理大致合理但不完整。总之,这些结果将 MAGI 定位为可插入现有计算化学工作流程的协调层。然而,实际项目的上限目前仍然由记分器的适用性而不是工具编排决定。

从基准到基准:智能体能否在现实世界的药物发现中幸存下来?的原论文方法或结果图
图 S1:MAGI 服务交互、MCP 接口和实验协议。 (一)系统架构。网关智能体将LLM推理后端连接到受监控的工具循环。通过 MCP 服务器,它管理版本化的治疗目标配置文件、优化作业、REINVENT 4、外部数据源和可独立部署的评分服务。共享存储在服务之间传输结构、配置和结果,而无需在语言模型上下文中放置大型工件。 TTP 定义评分流程;使用本机分子特性、Boltz-2 共折叠、姿态和相互作用分析、全局 ADMET 模型和项目特定的 RetroDMTA 模型对LLM提出的或 REINVENT 生成的分子进行批量评估。它们的组件输出被聚合并返回到生成循环以指导下一次迭代。 MCP 服务器公开了六组 24 种工具:服务发现、数据检索、TTP 管理、评分和预测、优化控制以及结果检索。 (b) 受控活动协议。项目背景、参考分子和目标均编码在版本化的 TTP 中。 LLM和 REINVENT 通过不同的途径生成候选者,但使用相同的活动、ADMET、Boltz-2 和交互评分服务。分级证据指导后续几轮,之后将最终候选化合物与从未向智能体展示过的测量留出化合物进行比较。