论文
面向优化建模的执行验证强化学习
Execution-Verified Reinforcement Learning for Optimization Modeling
摘要
用LLM自动化优化建模是迈向可扩展决策智能的一条有前景的路径,但现有方法要么依赖构建在闭源LLM之上、推理延迟高的智能体流水线,要么使用代价高昂的过程监督微调较小的LLM,而后者常常过拟合于单一求解器API。受可验证奖励强化学习的启发,我们提出Execution-Verified Optimization Modeling(EVOM),一个执行验证的学习框架,将数学规划求解器视为确定性、交互式的验证器。给定自然语言问题与目标求解器,EVOM生成面向该求解器的代码,在沙盒化环境中执行,并将执行结果转换为标量奖励,在生成-执行-反馈-更新的闭环过程中用GRPO与DAPO进行优化。这种仅基于结果的表述免除了过程级监督的需要,并通过切换验证环境而非重建面向特定求解器的数据集来实现跨求解器泛化。在NL4OPT、MAMO、IndustryOR与OptiBench上、跨Gurobi、OR-Tools与COPT的实验表明,EVOM与过程监督SFT持平或更优,支持零样本求解器迁移,并通过在目标求解器后端下继续训练实现有效的低成本求解器适配。
