论文
M100:支持通用人工智能计算的精心编排的数据流架构
M100: An Orchestrated Dataflow Architecture Powering General AI Computing
摘要
随着基于深度学习的人工智能技术的发展势头,对通用人工智能计算架构的需求持续增长。虽然基于 GPGPU 的架构为不同的 AI 工作负载提供了多功能性,但它们在效率和成本效益方面往往存在不足。各种特定领域架构 (DSA) 擅长特定的人工智能任务,但很难扩展到更广泛的应用程序或适应快速发展的人工智能环境。 M100 是理想汽车的回应:一种高性能、经济高效的架构,适用于自动驾驶 (AD)、大语言模型 (LLM) 和智能人机交互领域的人工智能推理,这些领域对于当今最具竞争力的汽车平台至关重要。 M100 采用数据流并行架构,其中编译器架构协同设计不仅协调计算,更重要的是,协调跨时间和空间的数据移动。利用数据流计算效率,我们的软硬件协同设计提高了系统性能,同时降低了硬件复杂性和成本。 M100 在很大程度上消除了缓存:张量计算由计算元件和片内/片外存储器之间流动的编译器和运行时管理的数据流驱动,比基于缓存的系统具有更高的效率和可扩展性。另一个关键原则是选择正确的操作粒度来跨编译器、固件和硬件进行调度、发布和执行。认识到人工智能工作负载的共性,我们选择张量作为基本数据元素。 M100 展示了跨各种推理应用的通用人工智能计算能力,包括 UniAD(用于 AD)和 LLaMA(用于 LLM)。基准测试显示,M100 在 AD 应用中的性能优于 GPGPU 架构,利用率更高,代表了未来通用 AI 计算的一个有前途的方向。