论文

Mimosa框架:迈向面向科学研究的演化式多智能体系统

Mimosa Framework: Toward Evolving Multi-Agent Systems for Scientific Research

智能体系统Agent 协作Agent Harness智能体互操作协议智能体自我改进MCP

摘要

当前的自主科学研究(ASR)系统尽管利用了大语言模型(LLM)与智能体架构,仍受制于固定的工作流与工具集,无法适应不断演化的任务与环境。我们提出 Mimosa,一个演化式多智能体框架,能够自动合成任务专属的多智能体工作流,并通过实验反馈迭代改进。Mimosa 利用模型上下文协议(MCP)实现动态工具发现,通过元编排器生成工作流拓扑,由代码生成智能体调用可用工具与科学软件库来执行子任务,并以基于 LLM 的评审器为执行打分,其反馈驱动工作流改进。在 ScienceAgentBench 上,Mimosa 搭配 DeepSeek-V3.2 取得 43.1% 的成功率,超过单智能体基线与静态多智能体配置。我们的结果进一步揭示,各模型对多智能体分解与迭代学习的响应存在异质性,表明工作流演化的收益取决于底层执行模型的能力。除基准测试外,Mimosa 的模块化架构与工具无关设计使其易于扩展,其完整记录的执行轨迹与归档的工作流保存了每一个分析步骤以供检查与潜在复现,从而支持可审计性。结合领域专家指导,该框架有潜力自动化各学科中广泛的、可经计算完成的科学任务。Mimosa 以完全开源平台的形式发布,旨在为社区驱动的 ASR 提供开放基础。

Mimosa框架:迈向面向科学研究的演化式多智能体系统:论文配图
图 1:Mimosa 框架。该系统通过五个连续层进行操作:(0)划分子任务——规划者将用户目标划分为子任务; (1) 发现工具——通过 Toolomics 扫描和枚举可用的 MCP 服务器; (2) 初始化工作流程——在档案中查询类似的先前任务,并从头开始检索或合成最佳匹配的工作流程; (3) 执行工作流——专门的代理使用发现的相关工具执行任务; (4) 评估工作流程——法官对执行进行评分,元协调器改变下一次迭代的工作流程;评估后的工作流程将被存档,并重复循环,直到判断分数超过 0.9 或达到预定义的迭代次数。