论文

CustomerSim:作为零售用户模拟器对多模式语言模型进行基准测试和调整

CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators

模型评测基准与评测资源

摘要

我们推出了 CustomerSim,这是一个环境和基准,用于评估 Multimodal 大语言模型 (MLLM) 在基于聊天的零售环境中模拟真实的、角色驱动的客户行为的程度。虽然之前的工作将用户模拟视为表面级对话生成,但我们重点关注模型在多轮代理模拟中寻找信息并做出符合客户规范的决策的能力。 CustomerSim 由人工策划的 5 个产品类别的 360 个角色组成,以及一套衡量客户模拟器的操作与其规范和对话质量之间一致性的指标。我们发现五个开源和闭源最先进模型之间存在一些行为差距。首先,虽然模型可以进行流利的对话,但它们的词汇多样性明显低于人类购物者,而且开源模型在开头过度披露了它们的标准。其次,模特往往会被销售代理的语气所说服,并且偏离角色规范。即使是最强大的闭源模型 Claude Opus 4.8 和 GPT-5.6 Sol,与其角色规范的一致性也低于 74%。为了解决这些限制,我们提出了 UserGRPO,这是一种多回合、多目标强化学习方法,可优化角色规范下的对话流畅性和决策一致性。 UserGRPO 将基线模型的决策一致性从 0.417 提高到 0.652,提高了 23.5 个点,而对话质量没有产生有意义的成本,并且这些增益转移到了保留的产品类别。我们进一步发现,风格提示是唯一使表面形式更像人类的干预措施,但它几乎使角色依从性减半。通过 CustomerSim,我们为社区提供了一个测试平台,用于调查和提高用户模拟器在目标导向设置中的依从性。