论文
LLM生成的GPU内核可上线吗:轨迹驱动基准与优化智能体
Are LLM-Generated GPU Kernels Production-Ready? A Trace-Driven Benchmark and Optimization Agent
摘要
既有GPU内核生成基准的题目来自合成或精选来源——与部署负载脱节。我们提出Atrex-Bench:其30个算子与440个形状直接采样自算力受限、内存充裕GPU的全集群生产推理轨迹。每个问题携带由其观测GPU时间份额(按应用卡时加权、按其运行的serving阶段分别计算)派生的重要性权重,附逐问题的屋脊线上限——使聚合分数强调消耗最多serving时间的内核。在Atrex-Bench上评估六个前沿编码智能体显示:即便最好的原始模型在生产算子上也只达硬件屋脊线的约10%;且仅正确性会夸大能力——因为相当部分表面通过率来自PyTorch回退而非模型写的内核。为弥合差距,我们共同发布Atrex-Kernel-Agent(AKA):一个剖析驱动的内核优化智能体——结合迭代测量—修订搜索、逃离停滞搜索上下文的优化dropout、以及分层GPU优化知识库(298个参考内核文件与244份优化知识文档,外加供API/ISA查询的外部上游参考项目)。在受控案例研究中:该智能体把零FlyDSL回退转为匹配或超过手工调优生产基线的真内核。
