论文

LLM能否击败经典超参数优化算法?自我研究研究

Can LLMs Beat Classical Hyperparameter Optimization Algorithms? A Study on autoresearch

模型评测模型能力评测

摘要

自动研究存储库使 LLM 代理能够通过直接编辑训练代码来优化超参数。我们使用它作为测试平台,将经典 HPO 算法与基于 LLM 的方法进行比较,以在固定计算预算下调整小语言模型的超参数。在通过自动研究定义固定搜索空间时,CMA-ES 和 TPE 等经典方法始终优于基于 LLM 的代理,其中避免内存不足故障比搜索多样性更重要。允许 LLM 直接编辑源代码缩小了与经典方法的差距,但并没有缩小差距,即使在撰写本文时有可用的前沿模型,例如 Claude Opus 4.6 和 Gemini 3.1 Pro Preview。我们观察到 LLM 很难跟踪试验中的优化状态。相比之下,经典方法缺乏 LLM 的领域知识。为了结合两者的优势,我们引入了 Centaur,这是一种与 LLM 共享 CMA-ES 可解释内部状态(包括均值向量、步长和协方差矩阵)的混合体。 Centaur 在我们的实验中取得了最好的结果,0.8B LLM 已经足以超越所有经典和纯 LLM 方法。无约束的代码编辑需要更大的模型才能与经典方法竞争。我们进一步分析搜索多样性、从 0.8B 到前沿模型的模型缩放,并消除 LLM 提出的半人马座试验的比例。总而言之,我们的结果表明,LLM 作为经典优化器的补充而不是替代品是最有效的。代码可在 https://github.com/ferreirafabio/autoresearch-automl 获取,交互式演示可在 https://ferreirafabio.github.io/autoresearch-automl 获取。