论文
GPU 预测器:语言模型作为内核运行时优化的选择性替代品
GPU Forecasters: Language Models as Selective Surrogates for Kernel Runtime Optimization
摘要
GPU 内核是现代深度学习的主力,优化它们(通过进化搜索或 编码智能体)通常需要对目标硬件进行重复测量。虽然这些测量提供了内核搜索所需的 真值 信号,但它们的成本很高,因为每次对内核的评估都需要在 GPU 上进行编译和重复执行。随着 LLM 推理的改进降低了编写新颖内核的成本,并且 LLM 驱动的搜索扩展到大量搜索预算,设备上评估成为瓶颈。为了解决这个问题,我们研究了 LLM 如何通过预测所提出的内核的性能来作为内核评估的选择性 GPU 替代品。有用的代理应该是准确的,并且应该是有选择性的,知道何时可能出错,并服从 GPU。为了评估代理,我们测量它们的预测是否准确、经过校准,并且对于在有限的 GPU 测量预算下恢复快速内核实际有用。接下来,我们研究强化学习是否可以提高预测准确性和置信度校准。我们的实验表明,LLM 可以准确预测相对内核性能,并且可以通过强化学习来提高其效用。在内核搜索中使用代理项,可以让搜索在相同的 GPU 评估预算下考虑数倍的候选者,从而找到比同等预算基准更快的内核。这些结果表明,LLM 可以充当 GPU 的虚拟模型,而不仅仅是充当搜索的内核生成器,从而在内核优化中发挥更广泛的作用。