论文

学习何时优化:源自专家GPU内核谱系的已验证优化技能

Learning When to Optimize: Verified Optimization Skills from Expert GPU-Kernel Lineages

智能体系统上下文与知识记忆Agent SkillsAgent记忆

摘要

基于LLM的智能体越来越多地被用于生成GPU内核,但它们往往知道可以尝试哪些优化,却不知道这些优化何时才可靠。我们提出KLineage,它从专家内核中学习这种缺失的“何时”知识:KLineage不依赖前向推演,而是沿验证门控的简化反向遍历专家实现,并将每一步被接受的简化逆转为一条可复用的优化技能。每条技能不仅记录优化意图,还记录它适用于代码中的哪个位置、哪些条件使其成立、它产生了什么效果,以及其前提假设能避免哪些失败。下游LLM在相同的编译/正确性/性能剖析门控下,将这些技能落实到新的代码表面上。在横跨两代NVIDIA架构的五个专家工作负载上,这些由谱系推导出的技能充当了有效的优化课程,在相同固定预算下,最终内核质量与优化效率均超过近期的基于记忆的LLM内核基线。我们还另外使用一个独立的22实例留出检查,作为防范源案例记忆化的健全性测试。

学习何时优化:源自专家GPU内核谱系的已验证优化技能:论文配图
图 1:KLineage 的动机。 (a) 前向搜索通常知道要尝试哪些优化,但不知道它们的前提条件是否成立。 (b) KLineage 使专家内核向后移动,以恢复从简单状态到专家状态的经过验证的前向转换。 (c) 恢复的技能仅作为代码锚定候选者重新使用,编译/测试/配置文件门决定新目标的录取。