论文

将智能体工作流编译进小模型权重的实证研究

Compiling Agentic Workflows into LLM Weights: Near-Frontier Quality at Two Orders of Magnitude Less Cost

模型训练智能体系统监督微调与指令调优Agent Harness

摘要

代理编排框架激增,包括 LangGraph、CrewAI、Google ADK、OpenAI Agents SDK、Semantic Kernel、Strands 和 LlamaIndex 在内的 GitHub 星数总计超过 290,000 个。所有这些都遵循相同的模式:大语言模型之上的外部协调器,每轮注入指令和路由决策。最近的工作表明,这种架构在过程性任务中占主导地位,只需在前沿模型的系统提示中提供过程 [Dennis et al., 2026a],但代价是消耗上下文窗口、每个对话都需要前沿模型以及向第三方提供商公开专有过程。将程序编译为小型微调模型的权重(创建地下代理)应该可以解决所有这些问题,并且之前的工作(SimpleTOD、FireAct、SynTOD、WorkflowLLM、Agent Lumos)已经表明该技术是有效的。然而,开发人员的采用绝大多数都支持编排。我们确定了三个感知到的障碍,并根据经验解决了旅行预订(14 个节点)、Zoom 支持(14 个节点、特定产品知识)和保险索赔(55 个节点、6 个决策中心)中的每个障碍。