论文
上下文内提示已使程序性任务的智能体编排过时
In-Context Prompting Obsoletes Agent Orchestration for Procedural Tasks
摘要
智能体编排框架——LangGraph、CrewAI、Google ADK、OpenAI Agents SDK等——在LLM之上放置一个外部编排器,每一轮都跟踪状态并注入路由指令。我们给出一个受控比较,表明对程序性任务而言,这种架构全面逊于一个更简单的替代方案:将整个流程放入系统提示并让模型自我编排。我们在三个领域——旅行预订(14节点)、Zoom技术支持(14节点)和保险理赔处理(55节点)——上对每种条件各评估200段对话,采用LLM-as-judge按五项质量标准打分。上下文内方法在5分制中得分4.53–5.00,而使用同一模型的LangGraph编排器得分为4.17–4.84。编排系统在旅行、Zoom和保险对话中的失败率分别为24%、9%和17%,而上下文内基线分别为11.5%、0.5%和5%。外部编排对早期模型或许是必要的,但前沿模型能力的进步已使其对遵循既定流程的多轮对话不再必要。