论文

BBOWP-Bench:评估 LLM 的黑盒优化应用问题

BBOWP-Bench: Evaluating LLMs on Black-Box Optimization Word Problems

模型评测基准与评测资源

摘要

制定优化问题会极大地影响最终解决方案的质量,但良好的制定通常需要大量的专业知识。因此,最近的研究研究了如何从自然语言描述中自动导出优化问题,但现有基准侧重于目标和约束可以明确编写为数学表达式的设置。许多实际重要的问题自然被视为黑盒优化(BBO)问题,其中只能观察到客观值,而无法获得函数形式。在BBO中,搜索空间设计、问题表述的一部分以及优化算法的选择对于解决问题至关重要。使用 大语言模型 (LLM) 自动化这些流程是一项重大挑战。本文介绍了黑盒优化字问题(BBOWP),这是一种新颖的问题设置,其中系统必须从黑盒优化任务的自然语言描述中推断出搜索空间和优化算法。为了支持对此设置的研究,我们建立了 BBOWP 基准套件(BBOWP-Bench),这是 BBOWP 的数据集和评估框架。每个实例都结合了自然语言问题描述、可执行评估环境和人工设计的基线公式,允许评估搜索空间设计和算法选择。使用此基准,我们提供了 LLM 的首次评估,并表明当前的 LLM 能够根据给定的评估预算选择合适的算法。然而,他们有时会在搜索空间设计方面遇到困难,特别是当问题描述信息较少或搜索空间高度特定于问题时,在识别重要变量并平衡其范围方面。我们的代码和数据集可在 https://github.com/shiralab/bbowp-bench 上获取。