论文

BoLT:昂贵的 LLM 任务的黑盒优化研究民主化的基准

BoLT: A Benchmark to Democratize Black-box Optimization Research for Expensive LLM Tasks

模型评测基准与评测资源

摘要

LLM 训练和推理配置(例如超参数、数据混合和提示)的优化对于性能至关重要,但在实践中通常采用启发式方法,可能会导致结果不理想。通过将它们视为嘈杂、昂贵且无导数的优化问题,贝叶斯优化 (BO) 和其他黑盒优化 (BBO) 方法为有原则的、样本高效的方法提供了一个有前景但尚未充分探索的方向。然而,对于大多数 BBO 研究社区来说,LLM 训练和推理成本过高,而且新方法通常仅在综合测试函数和小规模数据集上进行评估,而这些数据集无法捕捉现代 LLM 优化问题的挑战。这阻碍了 BBO 方法的开发,并且很难评估它们在现代 LLM 任务上的有效性。我们推出了 BoLT,这是第一个以 LLM 为中心的基准测试,它使 BBO 社区的 LLM 研究民主化。 BoLT 发布于 https://github.com/chewwt/bolt。 BoLT 涵盖广泛且动机良好的 LLM 优化问题,涉及多保真度、多目标、异方差噪声和高维搜索空间。 BoLT 中的每个问题都以真实的实验数据为基础,并通过适合数千个真实 LLM 实验结果的轻量级替代模型,使其完全可重现和可访问。我们针对广泛的 BO 和 BBO 方法对 BoLT 进行了基准测试,结果表明,选定的 BO 方法在各个任务中始终优于其他方法,并强调了现有 BBO 方法在 LLM 任务上的差距,强调了 BBO 社区基准现代化的必要性。