论文
KernelGenBench:LLM与智能体能跨算子来源和硬件平台写出高效内核吗?
KernelGenBench: Can LLMs and Agents Write Efficient Kernels Across Operator Sources and Hardware Platforms?
摘要
现代AI系统依赖专用的加速器内核,而日益多样的算子和硬件使这类开发愈发复杂。LLM与智能体系统有望将这项工作自动化,但现有评估无法说明其性能能否跨算子来源和硬件平台迁移,以及这种迁移的代价是什么。我们提出KernelGenBench,这是首个用于评估LLM与智能体生成Triton内核的统一多来源、多芯片基础设施。它以统一的Triton目标横跨六个硬件平台,在现有内核生成基准中提供了最广的跨厂商硬件覆盖。我们给出两个受控分析视图:KernelGenBench-MS(Multi-Source)覆盖来自PyTorch ATen、生产级vLLM算子和专有cuBLAS例程的210个算子;KernelGenBench-MC(Multi-Chip)则在六个硬件平台上评估语义稳定的110算子子集。我们的评估消耗了超过150亿token。智能体化执行提升了正确率,但没有哪种方法能在所有来源和平台上占优:vLLM构成最强的正确性挑战,cuBLAS设定了最高的性能上限,而AutoKernel的准确率从NVIDIA上的87%跌至Iluvatar CoreX上的25%。这些提升代价高昂:专用智能体平均每个成功算子消耗499万token,CUDA Optimized Skill更升至625万。这些结果确立了算子来源、硬件平台和智能体脚手架是内核生成能力的三个不同维度,并表明在熟悉的“来源-硬件”组合上取得成功并不能可靠代表部署就绪。