论文
面向推理LLM的策略感知优化建模
Strategy-Aware Optimization Modeling with Reasoning LLMs
摘要
大语言模型(LLM)能生成语法正确的优化程序,却常难以可靠选择有效的建模策略,导致表述错误与求解器低效。我们提出SAGE,一个策略感知框架,使「建模策略」在数据构建与后训练中显式化。SAGE构建经求解器验证的多策略数据集,训练学生模型:先监督微调,再用段加权GRPO,以格式合规、正确性与求解器效率的复合奖励。在覆盖合成与真实 setting 的八个基准上,SAGE将平均pass@1从最强开源基线的72.7提升到80.3。多次生成时,SAGE发现更多不同的正确表述,并在pass@16下将组件级多样性提升19-29%。在最大规模上,SAGE产出更紧凑的约束系统——约束数比基线少14.2%,与求解器高效建模一致。总体而言,这些结果表明显式化建模策略能改进自动优化建模。代码见GitHub。
