论文

通过证伪验证LLM生成的优化模型:可靠测试组及其检测边界

Falsification-Based Verification of LLM-Generated Optimization Models: Sound Test Batteries and Their Detection Limits

模型评测评测方法与指标

摘要

大语言模型能将决策问题的自然语言描述转换为可供求解器执行的优化模型,但错误往往不会显式报出:模型可以正常运行,却表达了错误的问题。常规评测依赖带标签的最优值,而实际部署中通常没有这样的参考答案。本文研究如何在没有参考模型的情况下验证生成的优化模型。 作者提出基于证伪的验证方法。问题中的数值具有明确角色,例如容量、需求或单位成本;正确模型应按照这些角色对数值变化作出响应。利用对偶与敏感性分析,论文构造了一组基于求解器的可靠测试:违反任一测试即可确认模型有误,因此这些测试在设计上不误报。论文同时刻画了此类测试无法发现的错误,给出了必然检测到各类典型错误的条件,并证明调节阈值的扰动测试无法同时满足可靠性和非平凡检测能力。 在326个真实标准模型、一个合成模型系列及四个公共基准上,结合两个生成模型进行测试,该测试组对忠实模型的误报率为0.0%,阈值测试的误报率为54.9%。它检测出56.1%的核心建模错误,在满足已证明前提的条件下检测出70.0%;对于论文证明无法由最优值评分发现的错误,检测出40.4%。结果也重现了理论预测的可检测性及盲区。每次报错都附有可由机器检查、能定位缺陷的证书;完整审计每个模型约需25次毫秒级求解器调用。该方法为AI生成的优化模型提供了严格、无需标签的补充评估。