论文

CANN Bench:以真实NPU与算法极限为锚的智能体生成内核基准

CANN Bench: Benchmarking Agent Generated Kernels against Real NPU and Algorithmic Limits

智能体系统模型架构MoEAgent任务评测

摘要

AI智能体现在能编写、编译并迭代优化不同硬件平台上的底层算子内核。但现有基准几乎只关注CUDA与Triton,使编程模型曝光较少的硬件生态缺乏共同评估基线。我们提出CANN Bench,一个面向华为昇腾NPU上AI生成算子代码的开放基准。当前版本覆盖53个算子、1060个测试用例,组织为四个难度层——从简单的逐元素原语到MoE dispatch与FlashAttention内核——横跨FP16、BF16、FP32与INT8精度。评估采用三维加权综合分:把编译、功能正确性与性能作为独立轴,为内核生成智能体提供有原则的奖励信号。性能以开箱即用的PyTorch-on-Ascend基线与真实NPU硬件上逐案例的解析硬件锚定性能(HAP)极限为分级,确保分数反映真实的优化余地而非测量伪影。评估环境从底层设计上抗奖励作弊。CANN Bench在官方CANN仓库内版本化管理,面向社区长期共建,为昇腾生态提供AI算子编写能力的量化、可复现、可持续维护的标尺。

CANN Bench:以真实NPU与算法极限为锚的智能体生成内核基准:论文配图
(a) 1060 个案例中的主要硬件瓶颈:MTE 63%、Vector 26%、Cube 11%。 (b) 每种情况的性能得分与候选运行时间 TcandT_{\text{cand}}:当 Tcand=THWT_{\text{cand}}=T_{\text{HW}} 时锚定为 11,当 Tcand=TbaselineT_{\text{cand}}=T_{\text{baseline}} 时锚定为 0.50.5,对于较慢的内核,则向 00 衰减。