论文
Vortex:面向AI智能体的高效可编程稀疏注意力服务
Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents
摘要
随着世代长度的不断增长,稀疏注意力对于服务大型语言模型(LLM)变得越来越重要。然而,大规模部署和评估新的稀疏注意力算法仍然是高度工程密集型的,这减缓了人类研究人员和人工智能代理探索稀疏注意力设计的速度。为了应对这一挑战,我们推出了 Vortex,该系统将 Python 嵌入式前端语言与以页面为中心的张量抽象相结合,用于表达各种稀疏注意力算法,并将高效后端紧密集成到现代 LLM 服务堆栈中。 Vortex 支持稀疏注意力算法的快速原型设计、部署和评估,有效地将其理论效率增益转化为现实世界的吞吐量改进。因此,Vortex 大大加速了稀疏注意力算法的设计和迭代。首先,AI 代理使用 Vortex 自动生成和完善各种算法,最好的吞吐量比完全注意高出 3.46倍,同时保持准确性。其次,Vortex 将稀疏的注意力扩展到新兴架构和非常大的模型上,否则很难进行实验,在基于 MLA 的 GLM-4.7-Flash 上达到高达 4.7的吞吐量,在 NVIDIA B200 GPU 上的 229B 参数 MiniMax-M2.7 上达到 1.37的吞吐量。
