论文
Kernel Forge:用于基于LLM的CUDA内核生成与优化的智能体脚手架
Kernel Forge: An Agent Harness for LLM-based Generation and Optimization of CUDA Kernels
摘要
机器学习模型日益嵌入日常软件,其运行时间大部分消耗在矩阵乘法、卷积和归一化等少量计算内核上。优化这些内核是降低延迟和成本最直接的途径之一,但传统上需要专家工程师手工编写底层GPU代码。基于大语言模型(LLM)的智能体系统如今能以远少于以往的人力生成和优化内核,但现有工具大多在随机生成的张量和孤立内核上评估,输出需要开发者手动重新集成的独立CUDA代码,多数只针对LLM PyTorch模型,且对结果的检查和调试支持有限。我们提出Kernel Forge,一个开源的端到端智能体脚手架,可直接就地接收任何未经修改的PyTorch模型。Kernel Forge支持视觉、扩散和LLM工作负载,使用蒙特卡洛树搜索(MCTS)探索多条优化路径而非单一线性改进链,并配有图形用户界面,用于监控进度、检查候选内核和调试失败。我们在配备GB10 GPU的NVIDIA DGX Spark上,对横跨视觉、扩散和LLM工作负载的四个PyTorch模型评估Kernel Forge。每个内核仅需50次优化迭代,它便将14个内核优化至超越PyTorch eager模式,在ResNet-50的adaptive\_avgpool2d上达到$1.52\times$,在Stable Diffusion 3.5 Medium的group\_norm上达到$1.70\times$,在Gemma 4 E2B的softmax上达到$2.83\times$,在Qwen 3.5 35B-A3B的softmax上达到$1.54\times$。
