论文

面向推理LLM的策略感知优化建模

Strategy-Aware Optimization Modeling with Reasoning LLMs

模型训练强化学习RLVR

摘要

大语言模型(LLM)能生成语法正确的优化程序,却常难以可靠选择有效的建模策略,导致表述错误与求解器低效。我们提出SAGE,一个策略感知框架,使「建模策略」在数据构建与后训练中显式化。SAGE构建经求解器验证的多策略数据集,训练学生模型:先监督微调,再用段加权GRPO,以格式合规、正确性与求解器效率的复合奖励。在覆盖合成与真实 setting 的八个基准上,SAGE将平均pass@1从最强开源基线的72.7提升到80.3。多次生成时,SAGE发现更多不同的正确表述,并在pass@16下将组件级多样性提升19-29%。在最大规模上,SAGE产出更紧凑的约束系统——约束数比基线少14.2%,与求解器高效建模一致。总体而言,这些结果表明显式化建模策略能改进自动优化建模。代码见GitHub。

面向推理LLM的策略感知优化建模:论文配图
图 1:为什么建模策略很重要。逐步管道可能会在不正确的索引空间(例如,(A,A)(A,A))上定义变量,从而创建无效的弧和运行时故障(例如,KeyError)。策略感知推理首先致力于一个范例(例如,基于流程)并限制决策域(例如,链接),产生一致且求解器可执行的模型。