论文

面向库存控制的 AI Agent:人类-LLM-OR 互补

AI Agents for Inventory Control: Human-LLM-OR Complementarity

智能体系统Agent任务评测

摘要

库存控制是一个基础的运营问题,其订货决策传统上由有理论依据的运筹学(OR)算法指导。然而,这类算法往往依赖僵化的建模假设,当需求分布发生偏移或相关背景信息不可得时可能表现不佳。大语言模型(LLM)的最新进展引发了人们对能够灵活推理并纳入丰富背景信号的 AI 智能体的兴趣,但如何最好地把基于 LLM 的方法融入传统决策流程仍不清楚。我们研究在多周期库存控制情境中,OR 算法、LLM 与人类如何互动并相互补充。我们构建了 InventoryBench,一个包含 1,000 多个库存实例、涵盖合成与真实需求数据的基准,用于在需求偏移、季节性与不确定提前期下对决策规则进行压力测试。通过该基准我们发现,经 OR 增强的 LLM 方法优于任一方法的单独使用,表明这些方法互补而非替代。我们进一步通过一项受控课堂实验考察人类的作用,该实验将 LLM 建议嵌入人在回路的决策流程。与先前“人机协作可能降低性能”的发现相反,我们表明人机团队平均能获得高于人类或 AI 智能体单独运作的利润。在这一群体层面发现之外,我们形式化了个体层面的互补效应,并推导出受益于 AI 协作的个体比例的无分布下界;实证上我们发现该比例相当可观。

面向库存控制的 AI Agent:人类-LLM-OR 互补
图4:Gemini 3 Flash:按方法划分的在全部 1,320 个实例上的总体归一化奖励(均值 ± 95% CI)。OR → LLM 取得最高均值(0.538),另一种混合方法(LLM → OR)位居第二。