论文
正确的答案,昂贵的模型:基于 LLM 的优化建模中的效率差距
Right Answers, Costly Models: The Efficiency Gap in LLM-based Optimization Modeling
摘要
优化建模将现实世界的决策问题表述为数学程序,求解器可以使用数学程序来找到最佳决策。大语言模型 (LLM) 可以自动执行此过程,但生成的正确公式可能需要大量时间和内存来构建和求解,从而限制了实际的可扩展性。因此,我们系统地研究大语言模型是否能够从自然语言描述中识别问题结构,并应用合适的优化建模技术来生成正确有效解决问题的数学模型和求解器代码。为此,我们首先策划 OptTips,这是一个包含 8 个系列 50 种专家建模技术的知识库。利用这些知识,我们开发了 OptDachshund,这是一个多Agent框架,可将现有优化基准问题转化为新任务,以评估大语言模型对建模技术的使用。它使用求解器代码针对相同的任务和数据构建传统的专家数学模型,为正确性和计算成本提供基线。由此产生的 EfficientOpt 基准包含 561 个经过专家评审的任务以及配对的参考实现。对 11 个具有代表性的大语言模型的评估揭示了在具有可比测量的正确解决任务上的效率差距:对于每个大语言模型,大多数生成的程序比其专家对应的程序需要更长的时间来解决。在可比较的参考大小子集中,57\% 具有正确目标值、较少变量和线性约束的程序记录的求解器时间较长。案例研究表明,不同的建模技术可以以相似的记录成本实现相同的最佳值。如果代码需要更长的时间来准备数据和构建模型,那么更快的求解可能不会减少执行时间。因此,应评估 LLM 优化模型的正确性和计算效率。