论文

LLM 什么时候值得用于超参数优化?对表格数据的预算匹配研究发现热启动是默认配置,而不是模型

When Is an LLM Worth It for Hyperparameter Optimization? A Budget-Matched Study on Tabular Data Finds the Warm-Start Is a Default Configuration, Not the Model

模型评测模型能力评测

摘要

大语言模型(LLM)已被提议作为超参数优化(HPO)顾问,从先验知识中“热启动”搜索,在很少的评估中提出强大的配置。我们在预算匹配的多种子协议下对八个 PMLB 表格基准进行了测试,将 LLM Advisor (LLM-OptFlow) 与四个经典基线(随机搜索、Optuna-TPE、高斯过程贝叶斯优化和连续减半)在一个共享搜索空间上进行比较,并在 8 x 5 = 范围内进行配对测试和引导 95% CI 40 个(任务、种子)单位。这一发现具有警示意义。 Advisor 的第一点根本不是 LLM 输出:与之前的 LLM-HPO 系统一样,循环以固定的默认配置为种子,在任何模型调用之前进行评估,仅达到 88.7% 的平均最佳 CV,与所有测试的七个 Advisor 模型的 0.01 pp 以内相同。 LLM 自己的提案仅在该种子上增加了 +0.40 pp 的交叉验证准确性,并且在保留测试中没有添加任何内容(LLM-默认 = -0.01 pp,p = 0.92)。当相同的种子被授予经典搜索时,明显的领先优势崩溃:相对于种子随机搜索,它在 2 次评估中领先 +0.20 个百分点,并列 5 个百分点,落后 12 个百分点(-0.37 个百分点)。如果没有种子,经典搜索在 12 项评估中将顾问程序追平,并以 40 项优势击败顾问(+0.6 到 +0.8 pp,p <= 1e-4)。两个 LLM 特定行为仍然存在:单任务探索失败(车辆),以及基于规则的置信过滤器,该过滤器在不改变准确性的情况下消除了约 33% 的浪费计算。建议是通货紧缩的:在表格 HPO 上,使用合理的默认值来种子经典搜索; LLM 顾问没有增加任何可衡量的泛化效益,并且在几次评估中被超越。我们发布了该工具和一个重现每个统计数据的脚本。