论文
CANN Bench:以真实NPU与算法极限为锚的智能体生成内核基准
CANN Bench: Benchmarking Agent Generated Kernels against Real NPU and Algorithmic Limits
摘要
AI智能体现在能编写、编译并迭代优化不同硬件平台上的底层算子内核。但现有基准几乎只关注CUDA与Triton,使编程模型曝光较少的硬件生态缺乏共同评估基线。我们提出CANN Bench,一个面向华为昇腾NPU上AI生成算子代码的开放基准。当前版本覆盖53个算子、1060个测试用例,组织为四个难度层——从简单的逐元素原语到MoE dispatch与FlashAttention内核——横跨FP16、BF16、FP32与INT8精度。评估采用三维加权综合分:把编译、功能正确性与性能作为独立轴,为内核生成智能体提供有原则的奖励信号。性能以开箱即用的PyTorch-on-Ascend基线与真实NPU硬件上逐案例的解析硬件锚定性能(HAP)极限为分级,确保分数反映真实的优化余地而非测量伪影。评估环境从底层设计上抗奖励作弊。CANN Bench在官方CANN仓库内版本化管理,面向社区长期共建,为昇腾生态提供AI算子编写能力的量化、可复现、可持续维护的标尺。
