论文
CuBridge:基于 LLM 的框架,用于理解和重建高性能注意力内核
CuBridge: An LLM-Based Framework for Understanding and Reconstructing High-Performance Attention Kernels
摘要
注意力机制的高效 CUDA 实现对于现代深度学习系统至关重要,但支持多样化和不断发展的注意力变体仍然具有挑战性。现有的框架和编译器以性能换取灵活性,而专家编写的内核实现了高效率,但难以适应。最近的工作探索了用于 GPU 内核生成的 大语言模型 (LLM),但之前的研究报告了注意力等复杂算子的正确性不稳定和显着的性能差距。我们提出了 CuBridge,一个基于 LLM 的框架,它通过结构化的 lift-transfer-lower 工作流程来适应专家编写的注意力内核。 CuBridge 从专家编写的 CUDA 注意力内核开始,并将它们提升为可执行的中间表示,使执行编排变得明确,同时抽象低级 CUDA 语法。给定用户提供的 PyTorch 规范,CuBridge 生成并验证目标 IR 程序,然后通过参考引导降低重建优化的 CUDA 代码。在不同的注意力变体和 GPU 平台上,CuBridge 始终能够生成正确的内核,并且大大优于通用框架、基于编译器的方法和先前基于 LLM 的方法。