论文

ConstraintBench:评测 LLM 直接优化中约束推理的基准

ConstraintBench: Benchmarking LLM Constraint Reasoning on Direct Optimization

模型评测基准与评测资源

摘要

大语言模型越来越多地应用于底层结构受限优化的运营决策。现有的基准评估大语言模型是否可以将优化问题表述为求解器代码,但留下了一个补充问题。大语言模型能否在不使用求解器的情况下直接为完全指定的约束优化问题生成正确的解决方案?我们推出 ConstraintBench,这是一个评估大语言模型在 10 个运筹学领域的直接约束优化方面的基准,所有真实解决方案均由 Gurobi 求解器验证。每个任务都呈现一个带有实体、约束和优化目标的自然语言场景;该模型必须返回一个结构化的解决方案,确定性验证器会根据每个约束和求解器验证的最优值进行检查。我们评估了 200 项任务的 6 个前沿模型,发现可行性而非最优性是主要瓶颈。最佳模型仅实现 65.0% 的约束满足,但可行的解决方案平均达到 Gurobi 最优目标的 89% 到 96%。没有模型的联合可行性和最优性在求解器参考的 0.1% 范围内超过 30.5%。每个领域的分析显示难度差异很大,平均可行性从生产组合领域的 83.3% 到机组分配领域的 0.8%。此外,系统故障模式包括持续时间约束误解、实体幻觉以及设施位置和车辆路线中的可行性-最优性解耦,其中模型实现了高可行性但最优性为 0%。 ConstraintBench和所有评估基础设施将公开发布。