论文

AiFlow:用于流媒体 LLM 应用程序的具有有限背压的词元本机反应式编排

AiFlow: Token-Native Reactive Orchestration with Bounded Backpressure for Streaming LLM Applications

智能体系统Agent HarnessAgent Runtime

摘要

大语言模型 (LLM) 应用程序越来越多地以流式工作流程的形式运行,结合了检索、工具调用、安全过滤器和多代理协调。尽管当代框架公开了提供者增量,但工作流节点通常将生成视为粗略的请求响应步骤,将队列管理、工作分配、排序和背压留给临时回调代码。本文介绍了 AiFlow,一种词元本机反应式编排模型,它将提供程序增量规范化为通过有向流图传播的类型化 Context<T> 事件。每个节点都由 Node Guardian 管理,该 Node Guardian 声明并强制执行本地队列边界、工作线程并发性、排序、溢出策略、取消传播和重试规则。我们形式化了有界内存属性,以紧凑的 DSL 和 JSON 图形形式呈现编译,并提供类型安全、状态并发和注入兼容性的静态验证。受控微基准测试、捕获的 DeepSeek 跟踪重放(30 次运行)、描述性在线运行、LangGraph 基线、流式 RAG 工作负载和 Ollama 本地后端检查表明,AiFlow 不会改变提供商端模型 TTFT,但与聚合相比将应用程序 TTFPT 减少了 70.9-94.7%,并将运行时拥有的队列深度保持在声明的范围内(与无界策略相比 MaxQ 减少了 93.7-96.5%)。补充工件包含脚本、原始跟踪、机器可读表、校验和以及无 API 的冒烟测试;公共实现可通过 FIT 框架存储库获得。