论文

从拓扑到轨迹:面向供应链韧性的LLM驱动世界模型

From Topology to Trajectory: LLM-Driven World Models For Supply Chain Resilience

智能体系统模型训练强化学习Agent 规划Agentic RL

摘要

在全球地缘政治动荡中,半导体供应链面临前所未有的韧性挑战。传统的大语言模型(LLM)规划器在应对此类非平稳的“政策黑天鹅”事件时,由于缺乏对物理环境的建模,常常陷入决策瘫痪或出现严重的落地鸿沟(Grounding Gap)。本文提出ReflectiChain,一个为韧性宏观经济供应链规划量身打造的认知智能体框架。其核心创新在于集成了由生成式世界模型驱动的潜在轨迹推演,将行动中反思(系统2审慎思考)与延迟的行动后反思耦合起来。此外,我们利用回顾式智能体强化学习(RL)机制,使策略能够在部署阶段(测试时)自主演化。在我们构建的高保真基准Semi-Sim上的评估表明,在出口禁令与物料短缺等极端场景下,ReflectiChain的平均步级奖励较最强LLM基线提升250%。它将可运行率(OR)从欠缺的13.3%成功恢复到88.5%以上,同时确保梯度稳定收敛。消融研究进一步强调,物理落地约束与双环学习的协同是在长程战略规划中弥合语义推理与物理现实之间差距的关键。

从拓扑到轨迹:面向供应链韧性的LLM驱动世界模型:论文配图
图 1:ReflectiChain 框架作为一个闭环自适应系统运行,通过双阶段反射过程弥合供应链决策中的“接地差距”:最初,系统综合多模态输入以促进“行动中的反射”,其中候选干预措施通过双路径潜在演练进行采样和过滤,同时通过 SC-WM 的时空动态优化语义合规性和物理接地。在高保真环境中执行和立即反馈缓冲之后,系统触发行动反思,利用回顾性后见之明机制,通过重新评估未来背景下的历史决策来解决临时信用分配问题,最终可操作为策略梯度,通过测试时 LoRA 适应从根本上发展参与者的潜在推理权重。