论文
购物推理基准:专家编写的多轮对话购物助理基准
Shopping Reasoning Bench: An Expert-Authored Benchmark for Multi-Turn Conversational Shopping Assistants
摘要
对话式购物助理现在为数亿客户提供服务,但现有的基准还没有联合评估真实购物对话所需的开放式多轮推理、领域专业知识和标准级质量。购物推理在语言模型应用程序中是独一无二的。与事实问答或可验证代码生成不同,它需要在多轮对话中平衡主观偏好、预算限制和跨产品权衡,这是以前的电子商务和通用基准测试所缺乏的功能。我们推出了 Shopping Reasoning Bench,这是一个由专家编写的基准,包含 525 个任务(232 个单轮,293 个多轮),以及由零售领域专家编写的 10863 个重要性加权的二进制评分标准。这些标准按照五个推理类别和十五个子类别的分类进行组织,涵盖偏好细化、权衡分析和兼容性评估等不同需求。对三个系列(GPT、Claude、Gemini)的九个模型的评估表明,总体通过率仅为 57--77%。在多轮任务中,所有模型在可选的超出标准上的得分比在必需标准上的得分低 13--29 分,并且随着对话的进展,性能会下降 4--18 分。这些差距表明,当前的模型可以处理基本的购物帮助,但缺乏专家级的建议,这使得购物推理台成为未来购物助理开发的具有挑战性的测试平台。