论文

AutoOR:可扩展的 后训练 LLM 自动公式化运筹学问题

AutoOR: Scalably Post-training LLMs to Autoformulate Operations Research Problems

模型训练强化学习

摘要

优化问题是制造、物流、调度和其他工业环境中决策的核心。将这些问题的复杂描述转化为可供求解器使用的公式需要专门的运筹学 (OR) 专业知识,因此难以扩展。我们推出了 AutoOR,这是一种可扩展的合成数据生成和强化学习管道,可训练 LLM 自动公式化跨线性、混合整数和非线性类别的自然语言指定的优化问题。 AutoOR 从标准优化形式生成经过验证的训练数据,并使用求解器执行反馈作为 RL 后训练 的奖励信号。应用于 8B 模型的 AutoOR 在六个已建立的 OR 基准上实现了最先进的或有竞争力的结果,与更大的前沿模型相匹配。对于涉及物理动力学的非线性问题类,前沿模型得分接近 0%,我们引入了一种课程 RL 策略,该策略从有限的初始训练数据中引导,使该类易于处理 后训练。我们相信 AutoOR 等方法可以通过人工智能显着加速工业决策。