论文

El Agente Forjador:面向量子模拟的任务驱动智能体生成

El Agente Forjador: Task-Driven Agent Generation for Quantum Simulation

智能体系统Agent 工具调用Agent Harness

摘要

AI for science有望加速科学发现过程。大语言模型(LLM)与智能体工作流的出现,使得越来越多的科学任务得以加速完成。然而,当前大多数智能体系统依赖静态、人工精心策划的工具集,这阻碍了对新领域和不断演化的代码库的适应。我们提出El Agente Forjador,这是一个多智能体框架,其中通用编码智能体通过工具分析、工具生成、任务执行和迭代解评估的四阶段工作流,自主锻造、验证并复用计算工具。我们在五种编码智能体设置上,对横跨量子化学与量子动力学的24个任务进行评估,比较三种运行模式:每任务零样本生成工具、复用由课程式构建的工具集,以及以编码智能体直接解题作为基线。我们发现,工具生成与复用框架相比基线持续提升准确率。我们还表明,复用由更强编码智能体构建的工具集可以降低API成本,并大幅提升较弱编码智能体的解题质量。案例研究进一步表明,为不同领域锻造的工具可以组合起来解决混合任务。综合来看,这些结果表明基于LLM的智能体能够利用其科学知识和编码能力自主构建可复用的科学工具,指向一种新的范式:智能体能力由其旨在解决的任务来定义,而非由显式工程化实现来定义。

El Agente Forjador:面向量子模拟的任务驱动智能体生成:论文配图
图 1:El Agente Forjador 概览。 (A) 我们在量子化学和量子动力学任务上评估我们的系统,这些任务涵盖分子结构优化、热化学和反应性、多体量子动力学以及量子态制备和控制。 (B) Forjador 工作流程包括四个阶段:工具分析(分解任务并搜索现有工具集)、工具生成(合成缺失的工具)、任务执行(组合工具并运行管道)和解决方案评估(迭代评估结果)。任务生成报告和可重用的工具集。 (C) 软件后端:本工作中使用的编码代理和科学软件。