论文
ABLE:LLM使用蛋白质设计工具的Agent基准
Agentic BAIM-LLM Evaluation (ABLE): Benchmarking LLM Use of Protein Design Tools
摘要
我们引入了 ABLE,这是一个评估 LLM 智能体在双用途蛋白质设计工作流程中使用生物 AI 模型 (BAIM)(例如 ProteinMPNN 和 AlphaFold3)的能力的基准。 ABLE 通过一组涵盖结构检索、序列生成和设计验证的任务来评估智能体性能。我们评估了 15 个前沿模型,发现其中 7 个模型拒绝所有任务,而其余模型表现出显着的性能差异。 Claude Sonnet 4 和 Gemini 3 Pro 在信息检索、工具选择和工具使用方面取得了最高分。我们进一步将任务子集上的模型性能与专家人类基线进行比较。我们的结果表明,目前的大语言模型可以大大降低蛋白质设计的障碍,但在规划、策略生成以及将生物学知识与工具使用相结合方面仍然不一致。
