论文

SupChain-Bench:面向真实世界供应链管理的大语言模型基准

SupChain-Bench: Benchmarking Large Language Models for Real-World Supply Chain Management

智能体系统Agent任务评测长程任务评测

摘要

大语言模型(LLM)在复杂推理与基于工具的决策中展现出潜力,推动其应用于真实世界的供应链管理。然而,供应链工作流要求以领域特定流程为基础的可靠长时程、多步骤编排,这对当前模型而言仍具挑战。为系统评估LLM在此情境下的表现,我们提出SupChain-Bench,一个统一的真实世界基准,同时评估供应链领域知识与以标准作业程序(SOP)为基础的长时程工具编排。我们的实验揭示了各模型在执行可靠性上的显著差距。我们进一步提出SupChain-ReAct,一个免SOP框架,可自主合成可执行的工具使用流程,取得最强且最稳定的工具调用表现。我们的工作为研究真实运营场景中的可靠长时程编排建立了一个有原则的基准,并凸显了基于LLM的供应链智能体仍有显著改进空间。

SupChain-Bench:面向真实世界供应链管理的大语言模型基准
图2:SupChain-Bench 的数据集构建流程遵循四阶段质量保证过程。首先,对供应链文档进行筛选与清洗,构建结构化知识库。其次,多智能体 LLM 框架在多种问题格式下生成多样化的 QA 候选。第三,这些候选项经过模型驱动的细化,以提升清晰度、一致性与事实正确性。最后,人工标注者进行严格核验,只有获得一致批准的 QA 对才会被纳入基准。