论文

面向复合AI系统的可扩展推理架构:一项生产部署研究

Scalable Inference Architectures for Compound AI Systems: A Production Deployment Study

AI 基础设施推理服务

摘要

现代企业AI应用日益依赖复合AI系统(compound AI systems)——即组合多个模型、检索器和工具来完成复杂任务的架构。将此类系统部署到生产环境,需要能够高效服务并发的异构模型调用、同时保持成本效益和低延迟的推理基础设施。本文介绍一项生产部署研究,对象是Salesforce开发的模块化、平台无关的推理架构,该架构用于支持包括Agentforce(自主AI智能体)和ApexGuru(AI驱动的代码分析)在内的复合AI用例。该系统集成无服务器执行、动态自动扩缩容和MLOps流水线,在多组件智能体工作流中提供一致的低延迟推理。我们报告的生产结果显示,与先前的静态部署相比,尾部延迟(P95)降低超过50%,吞吐量提升最高达3.9倍,成本节省30%至40%。我们进一步对复合系统特有的挑战给出新颖分析,包括多模型扇出开销、级联冷启动传播,以及在服务智能体工作负载时独有出现的异构扩缩容动态。通过详细的案例研究和运维经验,我们展示了该架构如何使复合AI系统能够并行扩展模型调用、应对突发性多智能体工作负载,并支持快速模型迭代——这些能力对在企业规模上落地智能体AI至关重要。

面向复合AI系统的可扩展推理架构:一项生产部署研究:论文配图
图 1.Atlas Reasoning Engine 中的认知编排。 Planner Agent 分解用户查询;工具选择器分派并行 LLM 工具(RAG 检索器、代码解释器、SQL 执行器)。结果由推理代理聚合并合成为最终响应。每个工具调用都由可扩展的推理架构支持。