论文
D2K-Bench GPU核生成
D2K-Bench: Can LLM Agents Turn Expert Designs into Efficient GPU Kernels?
摘要
LLM智能体生成的GPU核可能仍不及专家实现,但仅看运行时无法揭示差距与设计发现及实现的关系。我们提出D2K-Bench,一个含26任务85工作负载的诊断基准,测量智能体把专家设计指引转化为高效GPU核的能力。指引覆盖三层:L1高层算法洞见、L2数据流设计、L3底层优化技巧,并包含层级间依赖。带指引与不带指引的成对运行共享任务描述、工作负载、工具、硬件与350轮预算;补充评估检查独立提出的设计与生成代码实现的设计属性。在NVIDIA B200上的五个模型中,指引把130对模型-任务的正确率从93.1%提升到98.5%,把全部26任务的性能分从1.46提升到1.95。对三个在两轮中全部26任务都正确提交的前沿模型(GPT-6-Astra、Claude-Opus-4.8与GPT-5.6-Sol),几何均值加速从1.69倍升至2.49倍。五模型的平均综合实现分从57升至100分制的70。结果显示专家设计指引的价值,同时识别出仍未被实现的设计属性。