论文

RetailBench:评估工具使用LLM智能体在单店超市运营中的长程推理与连贯决策

RetailBench: Benchmarking long horizon reasoning and coherent decision making of LLM agents in realistic retail environments

智能体系统Agent任务评测长程任务评测

摘要

大型语言模型(LLM)代理在短期、范围广泛的任务上取得了快速进展,但它们在动态长期环境中维持一致决策的能力仍然不确定。我们推出 RetailBench,这是一个基于数据的模拟基准,用于评估单店超市运营中使用 LLM 代理的工具。 RetailBench 将零售管理建模为部分可观察的决策过程,旨在支持千日规模的模拟。在这种环境中,代理商必须管理定价、补货、供应商选择、货架分类、库存老化、客户反馈、外部事件和现金流限制。我们在 180 天的评估范围内评估代表性代理框架下的七个当代大语言模型,并将它们与特权预言机政策进行比较。结果显示,不同模型之间存在巨大差异:只有一小部分在整个评估范围内幸存下来,即使是最强大的大语言模型在最终净资产和销售结果方面仍然远远落后于预言机政策。行为分析将这些差距归因于证据获取不完整、决策制定肤浅以及缺乏一致的长期政策。 RetailBench 提供了一个受控测试平台,用于研究基于经济的长期决策中的可靠自主权。

RetailBench:评估工具使用LLM智能体在单店超市运营中的长程推理与连贯决策:论文配图
图 1:RetailBench 模拟环境概述。库存、货架分类、客户需求、供应商和订单、评论和退货、新闻事件以及财务和记录在此环境中耦合。