论文

Maestro:强化学习来编排分层模型技能集成

Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles

智能体系统Agent 工具调用

摘要

大语言模型(LLM)和模块化技能的激增赋予了自主代理越来越强大的能力。现有框架通常依赖于整体 LLM 和固定逻辑来与这些技能交互。这就产生了一个关键瓶颈:不同的 LLM 在不同的领域提供独特的优势,但当前的框架无法利用模型和技能的互补优势,从而限制了它们在下游任务上的性能。在本文中,我们提出了 Maestro(用于专家技能目标强化编排的多模态代理),这是一种强化学习 (RL) 驱动的编排框架,它将异构多模态任务重新构建为分层模型技能注册表上的顺序决策过程。 Maestro 不是将所有知识整合到单个模型中,而是训练一个轻量级策略来动态组合冻结专家模型和两层技能库的集合,在每一步决定是否调用外部专家、选择哪个模型技能对以及何时终止。该策略通过基于结果的强化学习进行优化,不需要任何步骤级监督。我们通过十个具有代表性的多模式基准对 Maestro 进行评估,涵盖数学推理、图表理解、高分辨率感知和特定领域分析。仅使用 4B 编排器,Maestro 的平均准确率就达到 70.1%,超过了 GPT-5 (69.3%) 和 Gemini-2.5-Pro (68.7%)。至关重要的是,学习到的协调策略无需再培训即可推广到看不见的模型和技能:用域外专家增强注册中心在四个具有挑战性的基准上产生了 59.5% 的平均值,优于所有闭源基准。 Maestro 进一步保持了高计算效率和低延迟。源代码可在 https://github.com/jinyangwu/Maestro 获取。