论文

面向多仓库存分配中运筹学建模方案选择的大语言模型

Large Language Model for Operations Research Formulation Selection in Multi-Warehouse Inventory Allocation

模型训练强化学习奖励建模与过程监督RLVR

摘要

多仓库存分配通常被形式化为混合整数规划(MIP)问题,然而没有任何单一形式化能够始终匹配由需求集中度、库存失衡、补货规模、服务约束与预测波动所导致的异构实例级情形。我们将这一问题研究为实例级的运筹学(OR)形式化选择,即为每个分配实例从候选OR专家库中指派一个求解器可执行的形式化。我们提出一个求解器引导的大语言模型(LLM)框架用于OR形式化选择,其中每个OR专家对应一种编码了不同分配优先级的MIP形式化。为训练选择器,该框架首先构建均衡的以专家为条件的监督微调(SFT)记录用于模式学习,然后在历史实例上使用MIP求解器评估,将求解器评估的分配质量差距转换为边距加权的身份偏好优化(IPO)偏好,以及用于在组相对策略优化(GRPO)期间查询奖励的逐实例专家得分元数据,从而为采样响应分配奖励。在来自中国最大电子零售商之一JD.com的多仓库存分配实例上的实验表明,GRPO相对SFT+IPO选择器大幅提升专家选择准确率,更重要的是,其产生的实际分配质量优于偏好训练的选择器与最佳固定形式化。使用GRPO后,Hit Ratio@1与Hit Ratio@2分别从21.45%提升到50.42%、从70.47%提升到82.31%。所得选择器相对现有基线取得12.57个百分点的分配准确率提升,优于SFT+IPO选择器与最佳固定OR专家,并将与事后神谕的差距缩小到4.85个百分点。