论文
CUDAHercules:针对 LLM 的硬件感知专家级 CUDA 优化进行基准测试
CUDAHercules: Benchmarking Hardware-Aware Expert-level CUDA Optimization for LLMs
摘要
大语言模型 显示了自动化 CUDA 编程的前景,但即使是最强大的编码模型(例如 Claude-Opus-4.6)也可能仍达不到专家级、架构感知的优化。我们引入了 CUDAHercules,这是一个基准测试,可根据端到端人类专家 SOTA 系统评估生成的 CUDA。它跨越 Ampere、Hopper 和 Blackwell GPU 上的单内核、模块级运算符、完整应用程序和未解决的挑战任务,以及由特定领域语义验证器控制的端到端任务。对 Claude-Opus-4.6 和 GPT-5.4 等模型的评估表明,可运行的 CUDA 与专家 CUDA 工程之间存在巨大差距:模型经常编译并通过测试,但很少恢复匹配专家性能所需的优化策略。应用程序语义进一步降低成功率,迭代或工具增强的反馈可以提高正确性,同时转向缓慢的回退实现。这些结果表明,自动化 CUDA 编程还远未完全解决,需要更强的硬件推理、更好的工具使用以及将代码理解与基于硬件架构的智能联系起来的训练目标。