论文
智能体专家系统中结构化LLM路由的运行时负担分配:全因子跨后端方法论
Runtime Burden Allocation for Structured LLM Routing in Agentic Expert Systems: A Full-Factorial Cross-Backend Methodology
摘要
结构化 LLM 路由常被当作提示工程问题。我们认为,它更根本地是一个系统级的负担分配问题。随着大语言模型(LLM)成为智能体 AI 系统的核心控制组件,可靠的结构化路由必须在真实部署约束下平衡正确性、延迟与实现成本。我们表明,这一平衡不仅取决于提示或模式(schema),还取决于结构化工作在生成栈中如何分配:输出结构是由模型直接产出、在传输中被压缩,还是在生成后于本地重建。我们通过一个全面的全因子基准来评估这一表述,覆盖 OpenAI、Gemini 与 Llama 后端的 48 种部署配置与 15,552 个请求。我们的核心发现影响重大:不存在普遍最优的路由模式。相反,后端特定的交互效应主导性能。在 Gemini 与 OpenAI 上保持高度可靠的模式,在 Llama 上可能出现大幅的正确性退化,而压缩实现带来的效率收益也强烈依赖后端。本工作并非又一项孤立的模型比较,而是贡献了一个可在异构后端条件下推理结构化路由的可部署框架。我们提供了跨后端评估方法学与实用的部署指南,用于在生产级智能体专家系统中权衡正确性-成本-延迟前沿。