论文
Orla:一个用于服务基于LLM多智能体系统的程序库
Orla: A Library for Serving LLM-Based Multi-Agent Systems
摘要
我们介绍Orla,一个用于构建和运行基于LLM的智能体系统的库。现代智能体应用由组合了多个LLM推理步骤、工具调用和异构基础设施的工作流构成。如今,开发者通常通过手工组合编排代码、LLM服务引擎和工具执行逻辑来构建这些系统。Orla提供了一个通用抽象,将请求执行与工作流级策略分离。它作为现有LLM推理引擎之上的一个服务层:开发者定义由阶段组成的工作流,而Orla管理这些阶段如何在模型和后端之间进行映射、执行和协调。它通过三种机制提供智能体级控制:阶段映射器,为每个阶段分配合适的模型和后端;工作流编排器,调度各阶段并管理其资源和上下文;以及内存管理器,跨工作流边界管理KV缓存等推理状态。我们通过一个客户支持工作流演示Orla,该工作流用到了它的许多能力。我们在两个数据集上评估Orla,结果显示,与单模型vLLM基线相比,阶段映射改善了延迟和成本,而工作流级缓存管理降低了首token生成时间。
