论文

AsmEvo:具有功能等效性验证的 AMD GPU 内核的智能体汇编级优化

AsmEvo: Agentic Assembly-Level Optimization of AMD GPU Kernels with Functional Equivalence Verification

智能体系统Agent 架构与控制循环

摘要

高性能机器学习系统越来越依赖 GPU 内核,其可编辑源代码不可用、已生成或与最终机器代码相差太远,无法暴露剩余的优化。现有的 LLM 内核优化器和自动调节器主要在 CUDA、Triton、HIP 或张量程序源上运行,并根据参考实现进行验证。我们研究了更严格的设置:优化已编译的 AMDGPU 代码对象,其中部署的二进制文件是唯一的行为预言机。我们推出了 AsmEvo,一种针对 AMD GPU 内核的智能体汇编级优化器。给定 AMDGPU 代码对象 K0,AsmEvo 会重建可重新组装的表示,使用长视野代理提出底层汇编修改,重建保留 ABI 的优化对象,并且仅在相同启动下针对 K0 进行差异验证后才接受候选对象。 AsmEvo 结合了代码对象恢复、元数据感知重建、分析引导的热窗口编辑、正确性门控计时和保守的就地补丁回退。我们使用 AsmEvo 在各种 AMD GPU 内核上进行了广泛的实验。在 MI308X 上,AsmEvo 改进了 30 个选定 KernelBench 内核中的 29 个,达到 1.35 倍几何平均和 3.88 倍最大加速比。在 MI300X 生产工作负载上,它改进了所有评估的 AITer 二进制文件和 vLLM/SGLang Triton 汇编内核,分别达到 1.09 倍/1.31 倍和 1.18 倍/1.34 倍几何平均/最大加速,同时保持功能等效性。