论文
UXBench:衡量 LLM 生成的 UX 批评的可操作性
UXBench: Measuring the Actionability of LLM-Generated UX Critiques
摘要
大语言模型 (LLM) 越来越多地被部署为用户体验法官,负责检查界面、诊断可用性问题并提出修复建议。然而,没有受控基准来衡量由此产生的批评在异构产品表面上是否可靠且可操作。我们引入 UXBench,这是一个评估 LLM 作为基于交互的 UX 评委的基准。 UXBench 包括跨越十个产品表面系列的本地优先可运行网络装置,与覆盖范围门控的浏览器探索相结合,迫使模型在报告之前收集交互证据。每个法官模型都会生成涵盖七个标题维度的结构化用户体验报告;报告质量是通过固定的下游修复代理是否可以根据批评改进界面来衡量的。我们根据自动修复提升协议和盲人验证研究评估了八个前沿模型。结果表明,用户体验判断既不是饱和的,也不是一维的:模型在报告可操作性方面存在显着差异,表现出不同的标题级维修特征,在灯具级可靠性方面存在差异,并且在表面类别上处于领先地位