论文

电子商务基准:评估 LLM 代理商的长期自主业务运营

E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation

智能体系统Agent任务评测长程任务评测

摘要

长期代理任务不仅仅是将短期任务链接到更多的交互轮次上。他们不断变化的动态环境和长期依赖性要求 大语言模型 (LLM) 不断探索、从经验中学习并通过数千个步骤调整其策略。我们推出了 E-Commerce Bench,这是第一个将多轮对手方谈判和动态事件集成到长达一年的业务运营中的开源基准。在一年 365 天的时间里,LLM 代理商同时经营多家网上商店,研究市场、与供应商谈判采购库存、优化销售策略、履行订单、处理退货和管理现金流,以最大化其年末总资产。为了构建真实的商家端运营环境,产品和供应商数据来自真实的电子商务平台,而长达一年的促销、自然灾害和供应链冲击不断重塑需求。为了可重复性,市场双方都是确定性的:客户购买和退货遵循固定的需求模型,而谈判内核决定供应商定价、优惠和决策,LLM 仅用于表述它们。我们评估了包括年终资产在内的七个维度的 18 个前沿模型,发现没有一个模型占主导地位。 GPT-5.6 Sol 赚得最多,将 100,000 份开仓股份增加到 1,431,425,但在避免欺诈方面,它在 18 家公司中排名第 16,并且在运营效率方面落后于 Fable5。在开放权重模型中,Qwen3.8-Max-Preview 以 416,252 领先,比 GLM 5.2(高)高出 38%,并实现了近期最强的学习能力,在重复订单中逐步压低价格。我们的代码可在 https://github.com/QwenLM/E-CommerceBench 获取。