论文

FrontierOR:评测LLM在大规模优化中高效算法设计的能力

FrontierOR: Benchmarking LLMs' Capacity for Efficient Algorithm Design in Large-Scale Optimization

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地用于优化建模和求解器代码生成,但实际的运筹学和优化问题通常需要更难的能力:设计可利用问题结构并超越直接公式化和求解基线的可扩展算法。现有的基准仅限于远低于现实世界规模和复杂性的小型或简化示例。我们引入了 FrontierOR,它是第一个针对实际大规模优化问题系统评估基于 LLM 的高效算法设计的基准。 FrontierOR 包括 180 个任务,这些任务源自在顶级运筹学场所发表的方法论多样化的论文,每个任务都有标准化实例和隐藏的、经过专家验证的评估套件。我们在一次性和测试时演进设置中评估了七个跨越前沿、具有成本效益的开源模型的大语言模型。结果表明,前沿模型仍然难以从可执行公式转向高效优化算法:在解决方案质量和计算效率方面,最强的一次性模型仅在 31% 的情况下优于 Gurobi,即使具有测试时进化的强大编码代理在选定的困难任务上也只能实现 50%。 FrontierOR为基于LLM的优化算法设计建立了一个实用的评估平台,使未来的LLM和代理能够得到系统的测试,看看他们是否能够超越正确的公式,转向可行的、高质量的、高效的算法。我们的 FrontierOR 基准可在 https://anonymous.4open.science/r/efficient-opt-bench-F03D 上获取。

FrontierOR:评测LLM在大规模优化中高效算法设计的能力
图 1:FrontierOR 基准测试概述。 FrontierOR 涵盖不同的问题领域、公式类型和应用领域。每个优化问题都涉及 10 2 10^{2} 到 10 7 10^{7} 个决策变量和约束,Gurobi 未能在一小时的时间预算内对 46% 的大型实例达到最优。我们通过收集领先OR期刊的问题来构建基准,并通过多轮专家评审来确保数据质量。