论文
MMShopBench:基于真实日志的多模态多轮购物Agent基准
MMShopBench: A Real-Log Benchmark for Multimodal, Multi-Turn Shopping Agents
摘要
在线购物者越来越多地依赖AI购物助手,使用图像和多轮对话来表达和细化仅通过文本难以表述的产品需求。然而,现有的基准测试主要依赖于文本输入或合成请求,未能充分代表通过图像和语言联合表达的复杂购物需求。我们引入了MMShopBench,这是第一个针对多模态、多轮对话的购物代理的实况基准。MMShopBench由精心清洗和手动注释的购物日志构建而成,为每个请求提供了购买意图和必需产品要求的基准注释。代理必须从用户图像和多轮对话中联合推断这些要求,通过图像和文本搜索检索候选产品,并使用其产品图像和结构属性验证每个候选产品是否满足所有要求。我们使用证据导向的多模态协议评估了代表性的开源和私有模型,并构建了一个配套训练集用于开源模型的微调。为了确保可重复的实验,我们构建了一个离线购物沙盒,其中微调显著缩小了我们开源模型与领先私有模型之间的性能差距,展示了我们的训练数据的有效性。
