论文
面向基于LLM的Triton内核优化的编译器锚定分层诊断
Compiler-Grounded Hierarchical Diagnosis for LLM-Based Triton Kernel Optimization
摘要
大语言模型(LLM)的最新进展使自动化内核生成与优化成为可能,但现有方法大多依赖编译反馈和性能剖析指标等表层信号。这些信号能说明内核慢,却不能说明后端编译器为何未能实现有益的优化,尤其是在NPU这类新型加速器上。因此,我们把内核优化表述为一个渐进式跨层诊断问题,在重写源代码之前先建立运行时症状与IR结构及编译器行为的关联。基于这一洞见,我们提出本系统,一个面向Triton内核的编译器锚定式分层优化框架。系统从轻量级的模式分诊与剖析诊断开始,只在需要更深证据时才升级到IR归因与编译器锚定分析,然后提出有证据支撑的源码级重写。我们在面向Ascend NPU的Triton上实现该系统,并在由标准化NPUKernelBench派生的Ascend 950基准中37个成功转换的条目上进行评估。在这些条目上,系统从初始Triton内核到优化后内核取得4.35倍几何平均加速与2.73倍中位数加速;37个中22个超过2倍,13个超过5倍。完整分布从接近基线的条目到大幅收益不等,这促使我们透明报告当前系统的适用范围与局限。
