论文
ModelEquivBench:认证LLM生成优化模型的多关系评估
ModelEquivBench: Certifying Multi-Relational Evaluation of LLM-Generated Optimization Models
摘要
大语言模型越来越多地从自然语言生成优化模型,但现有评测往往将生成模型与参考模型简化为单一的等价或不等价标签,或只看执行成功率。这些标签既不能独立核验,也无法忠实说明不同表述可以在哪些关系上保持一致。我们提出ModelEquivBench,一个携带证明的多关系评测系统,为每对模型报告E0—E6语义特征:模型构建与精确载入(E0)、经验证的表示对齐(E1)、同空间与投影后的可行集关系(E2、E3)、目标排序等价(E4)、最优值相等(E5)和最优解集合等价(E6)。每个已判定条目都附有适合该关系、可独立复查的证据:E0—E1使用可回放轨迹或显式映射,E2—E6的肯定结论使用精确有理数证书,支持的否定结论使用显式反例。不完整映射搜索、不支持的结构和资源限制产生有类型的UNKNOWN或N/A结果,而不是猜测;未满足前提则报告ABSENT。我们在同一冻结的173个基础问题上,以不修复协议评测GPT-5.4、Claude Sonnet 4.6和Qwen3.5-397B-A17B三个模型快照,每个模型对应346个单元。结果揭示粗略基线无法表达的区别:三模型分别有49、35、25个单元虽然候选可执行,却在至少一种受支持关系上被证实为否;另有25、8、18次结构拒绝发生在E2已通过验证映射证明可行集相等的模型对上。这些特征不能有意义地压缩成单一准确率分数。