论文
IBM LinuxONE 上的 Spyre 加速检索增强生成:面向安全、高吞吐企业 AI 推理的云原生架构
Spyre-Accelerated Retrieval-Augmented Generation on IBM LinuxONE: A Cloud-Native Architecture for Secure, High-Throughput Enterprise AI Inference
摘要
在企业环境中运行大语言模型一直撞上一堵现实的墙:数据存放在一处,AI 算力位于另一处,在两者之间搬运敏感记录会带来延迟、安全和监管暴露方面的实际难题。IBM 为 LinuxONE 及更广泛的 IBM Z 系列打造的 Spyre 加速器 PCIe 推理卡改变了这一格局。本文提出一种完全运行在 IBM LinuxONE 上的六子系统 RAG 架构:使用 Spyre 承担生成式推理,Telum II 片上加速器承担轻量级分类任务,Red Hat OpenShift 负责容器编排。从查询接入、向量检索、提示组装、LLM 推理、合规过滤到响应交付,流水线的每个环节都保留在单一 LinuxONE 系统内,因此敏感数据无需离开硬件边界。我们逐一阐述各子系统背后的设计选择,深入剖析 Spyre 编译与服务栈,解释 LinuxONE 的 Secure Execution 技术如何将机密计算保障延伸至 AI 工作负载,并将该架构与云端 GPU 及本地部署方案进行基准对比。早期分析显示,端到端 RAG 延迟低于两秒,相比异地(off-platform)推理最多可降低 20 倍,同时保持受监管行业真正需要的强加密与可审计能力。