AgentKernelArena:GPU 内核优化代理的泛化感知基准测试
AgentKernelArena: Generalization-Aware Benchmarking of GPU Kernel Optimization Agents
摘要
GPU 内核优化对于高效的深度学习系统越来越重要,但编写高性能内核仍然需要大量的低级专业知识。最近的 AI 编码智能体 可以迭代地读取代码、调用编译器和分析器并完善实现,但现有的内核基准测试评估单个 LLM 调用而不是完整的代理工作流程,并且没有一个基准测试同时包含内核到内核的优化和看不见的配置泛化测试。我们推出了 AgentKernelArena,这是一个开源基准测试,用于测量 GPU 内核优化上的 AI 编码智能体。该基准测试包含 196 个任务,涵盖 HIP 到 HIP 优化、Triton 到 Triton 优化以及 PyTorch 到 HIP 转换,并使用门控编译、正确性和性能检查、集中评分和看不见的配置泛化协议来评估隔离工作区中的完整代理工作流程,该协议测试优化是否转移到代理从未观察到的输入配置。在包括 Cursor Agent、Claude Code 和 Codex Agent 在内的生产代理中,我们发现大多数任务类别都具有近乎完美的编译和高正确率,最强的配置在 PyTorch 到 HIP 上实现了高达 6.89 倍的平均加速,在 HIP 到 HIP 上实现了 6.69 倍,在 Triton 到 Triton 任务上实现了 2.13 倍。我们看不见的配置评估表明,HIP 到 HIP 和 Triton 到 Triton 优化很大程度上转移到了看不见的输入形状,而 PyTorch 到 HIP 的正确性大幅下降,这表明从头开始生成内核的代理经常硬编码形状特定的假设。 AgentKernelArena 被设计为模块化、可扩展的框架,用于跨代理、任务和硬件目标严格评估代理 GPU 内核优化。