论文

LLM生成的GPU内核可上线吗:轨迹驱动基准与优化智能体

Are LLM-Generated GPU Kernels Production-Ready? A Trace-Driven Benchmark and Optimization Agent

模型评测基准与评测资源

摘要

既有GPU内核生成基准的题目来自合成或精选来源——与部署负载脱节。我们提出Atrex-Bench:其30个算子与440个形状直接采样自算力受限、内存充裕GPU的全集群生产推理轨迹。每个问题携带由其观测GPU时间份额(按应用卡时加权、按其运行的serving阶段分别计算)派生的重要性权重,附逐问题的屋脊线上限——使聚合分数强调消耗最多serving时间的内核。在Atrex-Bench上评估六个前沿编码智能体显示:即便最好的原始模型在生产算子上也只达硬件屋脊线的约10%;且仅正确性会夸大能力——因为相当部分表面通过率来自PyTorch回退而非模型写的内核。为弥合差距,我们共同发布Atrex-Kernel-Agent(AKA):一个剖析驱动的内核优化智能体——结合迭代测量—修订搜索、逃离停滞搜索上下文的优化dropout、以及分层GPU优化知识库(298个参考内核文件与244份优化知识文档,外加供API/ISA查询的外部上游参考项目)。在受控案例研究中:该智能体把零FlyDSL回退转为匹配或超过手工调优生产基线的真内核。

LLM生成的GPU内核可上线吗:轨迹驱动基准与优化智能体:论文配图
图 5:AKA 架构和外部工作流程:通过共享资源(GPU Wiki、分析和测量工具、参考模板)从用户输入到评估器就绪输出的七个编号阶段。