论文

SMDD-Bench:LLM 能否解决真实世界的小分子药物设计任务?

SMDD-Bench: Can LLMs Solve Real-World Small Molecule Drug Design Tasks?

智能体系统Agent任务评测长程任务评测

摘要

LLM 智能体在科学发现应用中具有惊人潜力。然而,LLM 智能体在跨越多样化学体系与靶点的真实世界小分子药物设计(SMDD)任务上的表现尚不清楚。现有评估方法要么临时拼凑、对真实发现而言过于简单、规模有限,要么仅限于单轮问答。为使 LLM 智能体在小分子设计上的评估标准化,我们提出 SMDD-Bench,一个具有挑战性的多轮长程智能体基准,由 502 个确保可解的任务实例组成,覆盖 5 种任务类型:2D 药效团识别、相互作用点发现、骨架跃迁、先导化合物优化与片段组装。SMDD-Bench 任务横跨广阔的化学空间,涉及 102 个独特的蛋白质靶点。完全解决该基准需要具备扎实的化学与生物推理能力及 3D 直觉,理解专用工具的使用,并在有限的 oracle 调用次数内展现规划专长。我们对 7 个前沿开源与闭源 LLM 进行基准测试,发现即使表现最好的 GPT5.4 也只解决 40.2\% 的任务。我们希望 SMDD-Bench 能提供一个标准化试验台,推动该领域训练与评估面向全自主计算药物设计的 LLM 智能体。我们在 smddbench.com 上维护公开排行榜。

SMDD-Bench:LLM 能否解决真实世界的小分子药物设计任务?:论文配图
图1:SMDD-Bench的任务类型总览及示例推理轮次,展示该基准如何考核LLM求解真实小分子药物设计任务的能力。