论文

ABLE:LLM使用蛋白质设计工具的Agent基准

Agentic BAIM-LLM Evaluation (ABLE): Benchmarking LLM Use of Protein Design Tools

智能体系统Agent任务评测

摘要

我们引入了 ABLE,这是一个评估 LLM 智能体在双用途蛋白质设计工作流程中使用生物 AI 模型 (BAIM)(例如 ProteinMPNN 和 AlphaFold3)的能力的基准。 ABLE 通过一组涵盖结构检索、序列生成和设计验证的任务来评估智能体性能。我们评估了 15 个前沿模型,发现其中 7 个模型拒绝所有任务,而其余模型表现出显着的性能差异。 Claude Sonnet 4 和 Gemini 3 Pro 在信息检索、工具选择和工具使用方面取得了最高分。我们进一步将任务子集上的模型性能与专家人类基线进行比较。我们的结果表明,目前的大语言模型可以大大降低蛋白质设计的障碍,但在规划、策略生成以及将生物学知识与工具使用相结合方面仍然不一致。

ABLE:LLM使用蛋白质设计工具的Agent基准:论文配图
图 1:通过 ABLE 任务评估的能力。 “蛋白质设计理论”是指蛋白质设计原理的知识和应用; “计算生物学工具”是指使用 Biopython 等非 ML 计算工具,“BAIM”是指使用基于 ML 的工具,例如 ProteinMPNN 和 AlphaFold3。