论文
MiniOpt:利用有限资源推理建模并解决一般优化问题
MiniOpt: Reasoning to Model and Solve General Optimization Problems with Limited Resources
摘要
对于面向优化的 大语言模型 (LLM) 来说,在需要有限训练资源的情况下在不同的优化问题上实现强大的优化泛化仍然是一个具有挑战性的问题。现有的方法通常依赖于大规模的监督数据集、昂贵的推理注释和昂贵的中间步骤验证,从而导致大量的训练开销。为了应对这些挑战,我们提出了 MiniOpt,这是一种强化学习框架,它通过“推理到模型和解决”范式学习解决优化问题。 MiniOpt 将优化推理分解为结构化优化建模和可执行求解器生成。在此范式的基础上,我们引入了 OptReward,这是一种具有分层评分结构的奖励函数,可共同评估制定和解决方案,无需专家演示即可实现有效的政策学习。我们进一步开发了一种面向优化的策略优化策略,可以提高探索效率并稳定紧凑模型的强化学习。大量实验表明,MiniOpt-3B 在各种优化类型、问题场景和任务域中表现出强大的优化泛化能力。对于参数少于10B的模型,MiniOpt系列实现了最高的平均求解精度(SA)。对于参数超过10B的模型,MiniOpt仍然表现出有竞争力的性能。这些结果表明,面向优化的奖励设计和强化学习为开发具有强大优化泛化能力的紧凑优化专用语言模型提供了有效途径。代码可在 https://github.com/Hsiang-1/MiniOpt 获取。