论文

MMShopBench:基于真实日志的多模态多轮购物Agent基准

MMShopBench: A Real-Log Benchmark for Multimodal, Multi-Turn Shopping Agents

智能体系统Agent任务评测

摘要

在线购物者越来越多地依赖AI购物助手,使用图像和多轮对话来表达和细化仅通过文本难以表述的产品需求。然而,现有的基准测试主要依赖于文本输入或合成请求,未能充分代表通过图像和语言联合表达的复杂购物需求。我们引入了MMShopBench,这是第一个针对多模态、多轮对话的购物代理的实况基准。MMShopBench由精心清洗和手动注释的购物日志构建而成,为每个请求提供了购买意图和必需产品要求的基准注释。代理必须从用户图像和多轮对话中联合推断这些要求,通过图像和文本搜索检索候选产品,并使用其产品图像和结构属性验证每个候选产品是否满足所有要求。我们使用证据导向的多模态协议评估了代表性的开源和私有模型,并构建了一个配套训练集用于开源模型的微调。为了确保可重复的实验,我们构建了一个离线购物沙盒,其中微调显著缩小了我们开源模型与领先私有模型之间的性能差距,展示了我们的训练数据的有效性。

MMShopBench:基于真实日志的多模态多轮购物Agent基准:论文配图
图1:MMShopBench 及其离线购物智能体工作流概览。真实的多模态、多轮日志被整理为289个案例,并标注隐藏的购买意图和必备需求。在冻结的10万件商品沙箱中,智能体推断需求,交替进行文本及区域感知的图片检索,再依据证据核验和选择;同一环境也支持教师轨迹的监督微调(SFT)与有证据支撑的评估。