论文

Vortex:面向AI智能体的高效可编程稀疏注意力服务

Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents

AI 基础设施模型服务框架

摘要

随着世代长度的不断增长,稀疏注意力对于服务大型语言模型(LLM)变得越来越重要。然而,大规模部署和评估新的稀疏注意力算法仍然是高度工程密集型的,这减缓了人类研究人员和人工智能代理探索稀疏注意力设计的速度。为了应对这一挑战,我们推出了 Vortex,该系统将 Python 嵌入式前端语言与以页面为中心的张量抽象相结合,用于表达各种稀疏注意力算法,并将高效后端紧密集成到现代 LLM 服务堆栈中。 Vortex 支持稀疏注意力算法的快速原型设计、部署和评估,有效地将其理论效率增益转化为现实世界的吞吐量改进。因此,Vortex 大大加速了稀疏注意力算法的设计和迭代。首先,AI 代理使用 Vortex 自动生成和完善各种算法,最好的吞吐量比完全注意高出 3.46倍,同时保持准确性。其次,Vortex 将稀疏的注意力扩展到新兴架构和非常大的模型上,否则很难进行实验,在基于 MLA 的 GLM-4.7-Flash 上达到高达 4.7的吞吐量,在 NVIDIA B200 GPU 上的 229B 参数 MiniMax-M2.7 上达到 1.37的吞吐量。

Vortex:面向AI智能体的高效可编程稀疏注意力服务:论文配图
(a) 带有 Vortex 的代理工作流程 (b) 代理生成的稀疏注意力 图 1:(a)。使用 Vortex 研究稀疏注意力算法的工作流程。 Vortex 通过轻松编程和高效推理来实现快速迭代和大规模验证,从而在稀疏注意力研究和现实世界服务系统之间架起桥梁。 (二)。代理生成的稀疏注意力算法在 NVIDIA H200 SXM 上的性能。每个点代表人工智能代理使用 Vortex 生成或优化的一个稀疏注意力。通过将可编程抽象与服务系统中的高效执行相结合,Vortex 能够实现大规模自主实验和迭代优化。生成的最佳稀疏注意力在保持准确性的同时,吞吐量比完全注意力高出 3.46×3.46 倍。