论文

迈向LLM赋能的智能体工作流可靠设计:优化延迟-可靠性-成本权衡

Toward Reliable Design of LLM-Enabled Agentic Workflows: Optimizing Latency-Reliability-Cost Tradeoffs

智能体系统Agent HarnessAgent Runtime

摘要

现代AI系统日益依赖由多个相互作用的智能体组成的工作流,其中一些由大语言模型(LLM)驱动,另一些由常规计算模块驱动。本文分析了LLM赋能的智能体工作流中延迟、可靠性与成本之间的基本权衡。我们为LLM智能体与非LLM智能体引入性能模型,刻画计算投入与输出质量之间的关系,并利用一个参数化指数可靠性函数将推理与输出token对LLM智能体的影响纳入其中。随后,我们研究在延迟与成本约束下顺序工作流的设计。主要结果包括一个注水式(water-filling)token分配策略,以及用影子价格对最优工作流可靠性的刻画。

迈向LLM赋能的智能体工作流可靠设计:优化延迟-可靠性-成本权衡:论文配图
图1:不同策略下的输出token分配对比,服务于LLM智能体工作流延迟-可靠性-成本的权衡优化。