论文

PACEShop:评估个性化、可操作、组合且基于证据的购物助理

PACEShop: Evaluating Personalized, Actionable, Compositional, and Evidence-grounded Shopping Assistants

模型评测基准与评测资源

摘要

购物助理正在从排名产品列表转向结构化决策支持,其中系统必须将购物者背景、产品证据和下一步指导综合成连贯的推荐体验。这改变了评估的单位:流畅的响应仍然可能会失败,因为忽略了购物者的背景,在组件之间自相矛盾,或者留下太模糊而无法定位的缺陷。现有的个性化、基础和 LLM-as-a-judge 基准涵盖了这个问题的一部分,但它们没有为结构化购物助理响应定义联合评估目标。我们将这个缺失的评估目标制定为 PACE:个性化、可操作、组合和基于证据的评估。我们用两个工件实例化 PACE:PACEShop,一个基准数据集,通过 22,625 个受控记录(具有结构化角色、可审计证据池、好/坏标签以及标准缺陷类别与位置标注)来衡量目标; PACEJudge,一种 无需训练 判断协议,可通过结构化输出合约使目标可报告。我们的实验表明,通用法官可以识别广泛的质量,但无法恢复 PACE 所需的诊断领域; PACEShop 使这些失败变得可验证,并且 PACEJudge 改进了角色来源、跨组件、基础和家庭/位置闭合,而无需重新训练,这表明现实的购物助理评估需要任务匹配的输出契约,而不仅仅是更强的主干或标量提示。