论文
生产LLM工作流的跨运行环境可移植执行
Substrate-Portable Execution for Production LLM Workflows
摘要
生产 LLM 智能体以多种模式执行工具调用循环、检索链和组合工作流,但执行语义通常耦合到一个运行时。我们在 Rufus 中遇到了这种可移植性问题,Rufus 是一个对话式 AI 助手,拥有庞大的工具目录,为数百万亚马逊客户提供服务。 Rufus 支持实时服务、异步后台任务以及大批量批处理工作负载(例如评估和内容预生成)。每种模式都有不同的服务级别目标,并且通常使用单独的运行时。重用流编排会阻塞异步和批处理工作负载,并阻止使用批处理推理 API,后者按公布的价格提供 50% 的折扣。我们提出了一个绑定自适应智能体执行平台,它将工作流定义与执行基础分开。开发人员将工作流程定义为类型化数据流图。该平台将图形编译为进程内流以实现实时服务、持久的 AWS SWF 编排以实现异步执行,或分布式 Apache Flink 流处理以实现批量推理。无需更改工作流程代码。 LLM 推理被表示为一个可挂起的图节点,其行为取决于底层:在线流式传输、异步持久重试以及离线批量提交。我们跨五种编排模式验证了数十种生产智能体配置:单推理 RAG、迭代 ReAct、组合 PreAct、条件路由和多智能体深度研究。在所有三种绑定中,我们没有发现输出质量存在可检测到的差异。批量执行降低了每个查询的推理成本,与已发布的批量 API 定价一致,同时在生产规模上与流路径一起运行。