论文

MerchantBench:评测LLM Agent在电商运营中的长期一致性

MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations

智能体系统Agent任务评测长程任务评测

摘要

大语言模型代理被越来越多地评估为自主工具用户,但大多数基准测试仅关注有限的任务,这些任务具有立即成功的标准。实际部署通常需要长期一致性,即在长时间内保留有意义的行为,同时根据积累的证据调整决策。评估这种能力需要一个持续的环境,其中行动限制了未来的选择,反馈以不同时期到达,不一致的行为会产生可测量的累积影响。通过重复和相互依赖的产品来源、列表和价格控制、现金流管理以及混合延迟反馈适应,卖家侧电子商务提供了一个适合这种评估的设置。通过使用98,843个真实电子商务产品的记录,我们引入了MerchantBench,这是一个基于26个工具的365天订单级别的模拟器。MerchantBench结合了及时可观察的上游供应商事件与延迟的下游订单结果,要求代理遵循个体订单生命周期并重新审视先前的决策。我们在48次实验中评估了八种大语言模型在两种代理框架下,每个实验覆盖365个模拟天。我们的结果揭示了即使是最新的大规模语言模型与人类参与者之间的显著差距,最佳的大规模语言模型配置仅达到人类参与者平均最终净资产的27.3%。