论文

异构计算:驱动AI智能体推理未来的关键

Heterogeneous Computing: The Key to Powering the Future of AI Agent Inference

模型评测评测方法与指标

摘要

AI智能体推理正在推动一个推理密集的数据中心未来,并暴露出计算之外的瓶颈——尤其是内存容量、内存带宽和高速互连。我们提出两个指标——操作强度(OI)与容量占用(CF),它们共同解释了经典roofline分析遗漏的状态,包括内存容量墙。跨agentic工作流(聊天、编程、网页使用、计算机使用)与基础模型选择(GQA/MLA、MoE、量化),OI/CF会发生剧烈变化,长上下文KV缓存使解码高度受内存限制。这些观察促使解耦服务与系统级异构:专用prefill与decode加速器、更广泛的scale-up网络,以及由光I/O实现的计算-内存解耦。我们进一步假设智能体-硬件协同设计、单系统内多推理加速器,以及高带宽大容量内存解耦,是适应不断演变的OI/CF的基础。这些方向共同勾勒出一条路径,以维持大规模agentic AI推理的效率与能力。

异构计算:驱动AI智能体推理未来的关键
图1:传统 roofline 模型只涉及最左侧的部分(蓝色与黄色区域)。高 MFU 表示计算受限区域(蓝色),而高 MBU 表示内存带宽受限区域(黄色)。然而,roofline 模型以及 MBU 与 MFU 的概念都无法清晰刻画由内存容量限制导致的欠利用。我们还将实际工作负载映射到这些区域,例如 Decode-FFN(低 B,高 L)表示 transformer 中低 batch size(B)与长序列长度(L)下的解码期 FFN 模块。