论文
MM-OptBench:面向多模态优化建模的求解器锚定基准
MM-OptBench: A Solver-Grounded Benchmark for Multimodal Optimization Modeling
摘要
优化建模将现实决策问题转化为数学优化模型和可被求解器执行的实现。尽管语言模型越来越多地被用于生成优化表达式与求解器代码,现有基准却几乎全部仅限文本。这忽略了许多在实际运营中出现的优化建模任务:其需求以文本描述,而实例信息则通过表格、图形、地图、日程和仪表盘等视觉载体传达。我们提出多模态优化建模(multimodal optimization modeling)这一基准设定,其中模型必须从文本加视觉的问题规范出发,同时构建数学表达式与可执行的求解器代码。为评估该设定,我们开发了一个以求解器为锚的框架:生成结构化优化实例,用精确求解器逐一验证,并从同一已验证来源构建面向模型的输入与隐藏参考文件。我们将该框架实例化为MM-OptBench,一个包含780个经求解器验证实例的基准,覆盖6大优化族、26个子类别和3个结构难度等级。我们评估了9个多模态大语言模型(MLLM),包括6个前沿通用模型和3个数学专精模型,并给出总体、族级、难度级与失败模式分析。结果表明该任务远未解决:最好的两个模型分别达到52.1%和51.3%的pass@1,而六个通用MLLM平均而言,pass@1在简单实例上为43.4%,在困难实例上为15.9%。三个数学专精MLLM均只解决0/780个实例。失败归因显示,错误既出现在从文本和视觉中提取实例数据时,也出现在将提取的数据转化为求解器正确的表达式与代码时。MM-OptBench为以求解器为锚、面向决策的多模态智能提供了试验场。
