超越扩展:通过体验驱动的工作流程和体验图内存实现硬件内核优化的自我进化 LLM 代理
Beyond Scaling: Self-Evolving LLM Agents for Hardware Kernel Optimization via an Experience-Driven Workflow and Experience Graph Memory
摘要
硬件内核优化需要反复编译、正确性测试、分析和修改。 LLM 代理可以自动化此过程的一部分,并且更强大的基础模型、更长的上下文窗口和更长的执行范围改进了单个任务内的优化。仅这些进步并不能让代理从已完成的优化运行中学习。现有的内核优化代理很少保留决策、其观察到的执行反馈以及使用该证据的后续决策。保留每条先前的轨迹也是不切实际的,因为不断扩展的历史会与当前任务争夺背景。我们推出 KOPE,一个用于硬件内核优化的经验驱动框架。 KOPE 在体验图内存中记录具有正确性和性能反馈的优化轨迹,然后使用主动上下文管理和注入在固定的 词元预算 下检索相关经验。该图保留了决策顺序、观察到的结果和替代分支,允许在目标硬件上收集的证据为后续的优化步骤和任务提供信息。在相同的 GLM-5.2 设置下,KOPE 每个算子加速的几何平均值是最强竞争基线 CANNBot 的 1.54 倍。在完整的 53 个操作员消融中,主动上下文管理和注入将通过率从 60.0% 提高到 84.6%,将评估者报告的正场几何平均值从 0.0382 增加到 0.0661,并将优化词元消耗从 15.9B 词元减少到 1.113B 词元(相对于被动代理主导的上下文构建)。启用体验图形内存可将全套通过率从 55.2\% 提高到 84.6\%,并在有效时序比较方面产生 $1.43\times$ 几何平均加速。这些结果支持在基础模型保持固定的情况下通过外部经验进行持续优化。