论文

UXBench:人工智能助手的用户体验基准测试

UXBench: Benchmarking User Experience in AI Assistants

模型评测基准与评测资源

摘要

随着人工智能助手每天为数百万用户提供服务,评估一般模型能力之外的用户体验 (UX) 变得越来越重要。我们提出了 \textbf{UXBench},这是第一个以用户为中心的基准,基于真实的用户反馈信号,用于评估偏好调整和对话生成。该基准测试由 UX Judge、UX Eval 和 UX Recovery 三个相互关联的任务组成,从中国主流人工智能助手的超过 70K 交互日志中提取了 7,400 个测试实例。该数据集密切反映了真实的用户分布,涵盖8个场景、83个领域以及带来严峻挑战的多种故障模式。对 26 种前沿语言模型进行的广泛实验为模型如何感知用户体验以及模型能力的改进如何有助于更好的对话参与提供了新颖的见解。通过对模型行为和性能差距的分析,我们记录了六个重要发现,证明用户反馈预测是一种可学习的能力,并揭示了影响用户体验的不同方面。 UXBench 建立了一个新的评估环境,并呼吁更多地关注定制的 UX 优化,为成功开发人工智能助手的以用户为中心的扩展法则做出贡献。完整项目发布于 https://github.com/mengze-hong/UXBench。