论文

MetaKernelBench:测量代码之外的 GPU 内核知识转移

MetaKernelBench: Measuring GPU Kernel Knowledge Transfer Beyond Code

智能体系统Agent任务评测

摘要

最近的 GPU 内核优化智能体保留了他们在知识库中学到的知识或作为提炼技能。内核基准测试对每次尝试的实施的正确性和速度进行评分,但未衡量保留经验的重用价值。我们引入了 MetaKernelBench,它衡量从一种内核特定领域语言 (DSL) 的尝试中提取的经验是否可以改善在另一种内核领域特定语言 (DSL) 中针对同一问题的新尝试。它的 74 个问题是 6 个族的融合子图,每个族都表现为一对 CuTe DSL 和 TIRx 变体,仅在 DSL 上有所不同。 智能体首先单独尝试每个变体,并被指示将其学到的内容提炼成自然语言技能,无论源尝试是否通过验证,该技能都会转移。该技能是其他 DSL 中相同模型进行技能条件尝试的唯一额外输入。我们将每个以技能为条件的尝试与在匹配的每次尝试预算、评分正确性和端到端运行时间下对同一变体的单独尝试进行比较。在六个模型和两个方向上,配对提升力相对于单独尝试的提升范围从 -19% 到 +29%。四个模型在两个方向上都有增益,但每个模型和方向上都有 16% 到 45% 的问题出现回归。结果遵循源尝试的结果相对于目标的单独尝试,而不是单独的源成功,当源高于目标时,71% 的比较会有所改善,而当源低于目标时,54% 的比较会下降。 MetaKernelBench 通过测量相同问题的跨 DSL 内核知识传输来补充实现质量指标。

MetaKernelBench:测量代码之外的 GPU 内核知识转移的原论文方法或结果图
图 1:MetaKernelBench 管道概述。左:一种 DSL 中性规范产生配对的 CuTe DSL 和 TIRx 变体。中:单独尝试使用验证者反馈来优化实施并将发现提炼为自然语言技能。右:只有源技能交叉到另一个 DSL 中的新尝试,并且配对提升将其实现与单独尝试的实现进行比较。