论文

UXBench Pro:多轮对话交互中的个性化用户体验基准测试

UXBench Pro: Benchmarking Personalized User Experience in Multi-Turn Dialogue Interactions

模型评测基准与评测资源评测方法与指标

摘要

在 UXBench 的经验证据的支持下,使用自动化计算方法评估用户体验 (UX) 受到越来越多的关注。然而,二元偏好预测提供的洞察力有限,而依赖与用户无关的单一奖励模型则忽略了用户固有的异质性,而用户的期望可能存在很大差异。在本文中,我们介绍了 UXBench Pro,其中包含 1{,}000 个测试实例,这些测试实例源自 12 个任务场景和 82 个领域的真实用户交互。每个实例都与 FACTORS 用户配置文件配对,该配置文件通过七个可解释的行为方面来描述用户的特征,从而区分用户组。为了提供更丰富的评估见解,我们引入了一种双视角范例,它将用于第三人称判断的个性化用户奖励模型(URM)与 Sim4Eval 相结合,Sim4Eval 是一种用户模拟器,可实现多轮交互并提供跨四个认知状态维度的第一人称评估。为了评估这些基于评估器的可靠性,我们进一步引入了两个元基准,URMBench 和 USimBench, 评估它们如何忠实地再现真实的人类偏好和行为。广泛的实验揭示了七个关键发现,强调了用户建模和多视角评估的重要性,为以用户为中心的基准测试和激励个性化模型优化提供了新的视角。