论文

CAKE:前沿内核演进的编译器-代理协同设计

CAKE: Compiler-Agent Co-Design for Frontier Kernel Evolution

智能体系统Agent Harness

摘要

GPU 内核代理和 GPU 编程语言各自进步,使得专家内核难以重现。代理通常将编译器视为固定的黑匣子,仅接收错误、正确性结果和时序,而现有的 DSL 要么隐藏关键的调度决策,要么通过困难的布局抽象来暴露它们。我们提出了 CAKE,一种编译器-代理协同设计,其中代理编写了 CAKE IR,一种类型化的、硬件显式的调度表示。 CAKE 公开扭曲角色、内存移动、同步和管道,同时支持验证、成本建模和本地化诊断。该工具本身也在不断发展:反复出现的故障变成了验证者规则、IR 基元、模型校准和可重复使用的优化策略。在 B200 上匹配的实现隐藏 Flash-KMeans 干净启动中,8000 万个 词元预算 上的最佳 CAKE IR 候选运行速度是调整后的 FlashML 基线的 1.144 倍,而直接 CUDA/PTX 的运行速度是 0.928 倍。除了这个基准之外,代理生成的 Kimi Delta Attention 比官方 FlashKDA 实现了 2.05 倍的几何平均加速,并通过了端到端服务验证。调度程序支持的 KNN 和 KMeans 在 400 多个形状中将性能提高了 1.42 倍到 2.12 倍,并且四个内核更改可用作上游 PR。 CAKE 针对从 Ampere 到 Blackwell 的 NVIDIA GPU,并将单一形状演化与库泛化和调度分开。