论文

FastKernels:生产中 GPU 内核生成的基准测试

FastKernels: Benchmarking GPU Kernel Generation in Production

模型评测基准与评测资源

摘要

用于 GPU 内核生成的基于 LLM 的代理正在快速发展,但它们针对独立评估内核进行优化的基准,具有合成输入和弱基线,奖励沙箱加速,这在实际推理系统中会破坏或消失。我们引入了 FastKernels,这是从 8 个类别的 47 个代表性架构中抽取的 384 个任务的基准,其内核足以重新实现 94.6% (472/499) 的 HuggingFace Transformer 架构,其输出与本机实现相匹配。每个任务都镜像相应生产模块的接口,并根据内核生产框架进行评分,任务形成从原语到完整模型的组合层次结构,其中较高级别的模块导入较低级别的模块。在生产执行路径上,候选者在其来自的模型内进行内核级别和端到端的评分,MacroEval 将校准的正确性、覆盖率和加速率汇总到排行榜中。用五个代表性代理(6,900 个代理小时)进行播种,我们发现内核级加速从 $1.6$-$6.6\times$ 缩减到最多 $1.25\times$ 端到端,只有 20% 的获胜内核集按原样正确运行,并且内核级分数对代理进行了错误排名:Claude Code 在每个级别上单独匹配或击败 KDA,但 KDA 端到端得分高出 $3\times$。代码可在 https://github.com/Snowflake-AI-Research/fastkernels 获取。