论文

像人类一样优化 CUDA:微分析工具作为基于 LLM 的 GPU 内核优化的专家替代品

Optimizing CUDA like a Human: Micro-Profiling Tools as Expert Surrogates for LLM-Based GPU Kernel Optimization

智能体系统Agent 工具调用

摘要

我们推出了 KernelPro,这是一个闭环多代理系统,通过将 大语言模型 (LLM) 代码生成与硬件分析器反馈和可插入瓶颈检测工具集成,自动生成、分析和迭代优化 GPU 内核代码。 KernelPro 引入了四个贡献:(1) 语义反馈运算符,将专家启发法编码为可插入的微分析工具,将原始硬件指标转换为可操作的自然语言指导; (2)两阶段工具调用架构,其中基于屋顶线的瓶颈分类过滤器由专门的分析工具执行,结合内核级(ncu)、指令级(SASS)和系统级(nsys)分析; (3) 具有渐进加宽、不对称分支、对数奖励校准、死端修剪和用于交叉迭代学习的搜索记忆的领域适应MCTS; (4) 通过 CUTLASS/CuTe 代码库上的自主代码搜索直接生成 CuTe 源代码。在 KernelBench 上,KernelPro 在 1/2/3 级上实现了 2.42x/4.69x/5.30x 的几何平均加速,在所有难度级别上建立了最先进的性能。在 VeOmni 的专家优化 MoE 训练内核上,KernelPro 通过生成从头开始的原始 CUDA+CuTe Hopper WGMMA 内核,实现了手动调整 Triton 的 1.23 倍。消融研究表明,每个设计组件都独立且显着提高了优化质量:微观分析工具(与原始指标相比,p < 0.0001)、MCTS 搜索(与贪婪算法相比,几何平均值高 26%,p = 0.004)和主动工具编排(改进 23%,p = 0.035)。最后,KernelPro 是第一个 CUDA 内核 编码智能体,它超越了先前系统仅关注速度的范围来优化能源效率,在匹配的速度下测量到的能源减少了 11.6%。