论文

SemOPT:通过奖励引导搜索修复基于 LLM 的优化建模中的语义错误

SemOPT: Fixing Semantic Errors in LLM-based Optimization Modeling via Reward-Guided Search

模型推理推理验证与自校正

摘要

运筹学支持能源、经济和医疗保健等领域的决策。解决运筹学问题通常从优化建模开始,它将自然语言问题描述转换为可执行的求解器代码。大语言模型提供了一种很有前途的方法来自动化这一过程,但它们仍然容易出错。在实践中,这些错误可以分为两类:语法错误是指求解器代码未能成功运行或被求解器判断为不可行;语义错误是指求解器代码成功返回目标值,但违反了原始问题的意图。由于语义错误不会触发运行时故障,因此很难检测和纠正。为了解决这个问题,我们引入了 SemOPT,一个用于纠正基于 LLM 的优化模型的语义引导框架。 SemOPT 将语义奖励模型与自适应校正系统相结合,语义奖励模型将忠实的数学模型与看似合理但不正确的数学模型区分开来,该自适应校正系统在建模空间上应用分层奖励引导搜索。七个优化建模基准的实验表明,SemOPT 建立了新的技术水平,与复杂数据集上最强的基线相比,平均准确度提高了 7.6%。