论文
OptiVerse:解决优化问题的综合基准
OptiVerse: A Comprehensive Benchmark towards Optimization Problem Solving
摘要
虽然 大语言模型 (LLM) 展示了出色的推理能力,但复杂的优化任务仍然具有挑战性,需要领域知识和强大的实施。然而,现有基准狭隘地关注数学规划和组合优化,阻碍了综合评估。为了解决这个问题,我们引入了 OptiVerse,这是一个涵盖 1,000 个精选问题的综合基准测试,涵盖被忽视的领域,包括随机优化、动态优化、游戏优化和最优控制,分为三个难度级别:简单、中等和困难。使用 22 个不同大小的 LLM 进行的实验表明,在困难问题上性能急剧下降,即使是 GPT-5.2 和 Gemini-3 等先进模型也难以超过 27% 的准确度。通过错误分析,我们发现建模和逻辑错误仍然是主要瓶颈。因此,我们提出了一种双视图审计代理,可以提高 LLM 建模过程的准确性,而不会引入大量时间开销。 OptiVerse 将作为推进 LLM 解决复杂优化挑战的基础平台。