论文
EComAgentBench:分布式隐藏意图下长程购物智能体基准
EComAgentBench: Benchmarking Shopping Agents on Long-Horizon Tasks with Distributed Hidden Intent
摘要
随基于LLM的购物智能体进入生产——既有基准未能捕捉购物者需求如何到达:隐含在查询中、记录在画像中——或只在问到对的问题时才显露。预先暴露全部意图、仅给最终选择打分的基准——既无法构成这种长程挑战——也无法解释智能体漏了哪条需求。为填补缺口——我们介绍EComAgentBench——662个任务、扎根于真实Amazon商品与评论的基准。每个任务把需求散布在可见查询、工具门控的画像与脚本化澄清中:智能体必须发掘隐藏意图、对照属性与评论证据核验候选——并在100次工具调用内对单一商品做出承诺。此外——带类型、带来源标签的量规为每个任务评分——把每次失败归因到一条需求及其来源。构建自动化且可靠:每个答案在任何文本生成前已在代码中固定——每个样本经验证。对七个模型的评估揭示:即使最强模型总体准确率也仅57.1%——量规满足度从可见来源到隐藏来源递减。总体而言——我们相信EComAgentBench将成为推动购物智能体从单查询搜索走向长程可靠辅助的可复现基础。