论文

先验知识还是搜索?LLM智能体硬件感知代码优化研究

Prior Knowledge or Search? A Study of LLM Agents in Hardware-Aware Code Optimization

智能体系统Agent任务评测

摘要

LLM发现与优化系统正被越来越多地应用于各个领域,实现着共同的提出-评估-修订循环。这类优化或发现通过对环境反馈进行上下文条件化而推进。然而,随着现代LLM智能体结构日益复杂,很难评估哪些组件贡献最大,以及这种探索会在何时、以何种方式失败。我们通过三个受控实验回答这些问题。我们的发现:(1)在纯黑盒优化中,LLM表现为贪婪优化器。(2)在零样本核生成中,提供显式的输入规模信息没有可测量的效果:无论规模或温度如何,模型都收敛到相同的核参数,仿佛规模指令不可见。此外,当被要求对不常见的核规模执行核优化时,无论使用何种语言,性能都急剧下降。(3)在反馈循环核优化中,CUDA在迭代反馈下单调改进,而TVM IR则持续退化,这表明当模型运行在低密度语言上时,核优化会退化。我们的结论是:LLM在代码优化任务中高度依赖预训练先验,而非所提供的反馈或智能体结构。

先验知识还是搜索?LLM智能体硬件感知代码优化研究:论文配图
图 1:优化轨迹示例。LLM通常遵循贪婪的线状轨迹,要么快速收敛,要么致力于次优方向。附录 M 中提供了二维 BBO 轨迹的附加说明。