论文
自主AI代理在供应链管理中的可靠性与有效性
Reliability and Effectiveness of Autonomous AI Agents in Supply Chain Management
摘要
本文使用麻省理工学院啤酒游戏研究多级供应链中的自主生成人工智能代理。我们确定了影响性能的四个推理时间杠杆:模型选择、策略和护栏、集中数据共享和提示工程。模型能力是主导因素:开箱即用的推理模型超越人类水平的性能,优化的推理模型相对于人类团队可降低高达 67% 的成本。然而,强劲的平均性能掩盖了巨大的可靠性风险。我们引入了代理牛鞭效应,即跨梯队决策不可靠性的放大,体现在两个维度上:同一时间点之间的决策方差增加以及不同时间同一设施内的决策方差增加。我们开发了一个数学框架,表明这种现象是涉及协调和信息延迟的多智能体系统所固有的,并且我们证明重复采样无法有意义地减少这种现象。为了解决这一限制,我们提出了一种基于组相对策略优化(GRPO)的强化学习后培训框架,该框架使用系统级供应链奖励来培训共享基础大语言模型。 GRPO 后训练大大减少了尾部事件,减少了代理牛鞭,并提高了自主供应链代理的可靠性。
