论文
LLM 驱动的 GPU 内核生成的利用工程
Harness Engineering for LLM-Driven GPU Kernel Generation
摘要
大语言模型(LLM)可以辅助GPU内核生成,但其实际效果取决于生成的代码是否可以可靠地约束、验证、分析和选择。本文在 NVIDIA Blackwell B200 GPU 上的 MLSys 2026 FlashInfer AI 内核生成竞赛中提出了一种以Harness为中心的系统,用于 LLM 驱动的 GPU 内核优化。该系统将评估工具与配置文件支持的优化控制器分开:工具强制编译、正确性、官方对齐的计时和工件存档,而控制器将分析器和工作负载证据转换为有界候选生成决策。人类编写的技能捕获操作员约束、参考、分析程序和升级规则,而 Codex 和 Claude Code 代理在这些约束内生成候选内核。在五个运算符定义中,保留的官方对齐工件比提供的 FlashInfer 基线实现了 1.62x、18.05x、29.68x、1.12x 和 13.70x 的平均延迟加速。在评估的定义中,代理辅助内核的性能优于全代理工件,这表明专家提供的优化方向、高质量参考和工作负载上下文对于可靠的人工智能驱动的内核优化仍然至关重要。