StoreBench:以动态电商经营检验长期Agent决策
StoreBench: A Live-Commerce Environment for Evaluating and Training Autonomous Operator Agents
摘要
强化学习环境现在是在训练后提高大语言模型(LLM)能力的主要杠杆,但大多数 agentic 基准仍然是静态的:只有当代理行动时世界才会移动,奖励是最终判决,并且通过标准是任意设置的。我们介绍 StoreBench,这是一个实时商务环境,代理商在生产级商务后端上运营一家中型在线服装商店,在不确定性下测试长期规划和经济判断。客户全天候订购,供应商重新定价并失败,市场冲击在部分或没有警告的情况下到来。代理通过人类操作员使用的相同 29 个商业工具进行操作,在窗口化操作预算下,使模拟时间成为所采取操作的函数,因此模型延迟不会影响模拟时间。通过阈值根据脚本化的锚定策略进行校准,奖励针对一系列奖励黑客进行强化,并且在给定一系列操作的情况下,每个情节都会以相同的方式重播。我们在 30 至 11 种场景中评估了 7 个前沿LLM。 45 天和一个完整的模拟年,超过三名世界种子的推理能力相匹配。平均而言,没有一个模型与脚本化的智能分类策略相匹配:最好的 DeepSeek-V4-Pro 通过了 49% 的任务种子单元,而启发式的通过率为 97%。使用相同工具和预算工作的人类专家的得分超过了每个模型(平均综合得分 0.708 与 0.700)。在 Claude Code 利用下进行的完整模拟一年中,大多数模型都显示出显着的性能改进。在 GRPO 训练后运行中,仅接受五个不相交任务训练的 Qwen3.5-27B 将其在保留评估任务上的平均复合值从 0.136 提高到 0.373。我们发布了五个示例训练分割任务、十个样本轨迹以及评分和验证工具;完整的环境和评估套件被保留,以保持基准不受污染。