论文
PerceptUI:LLM智能体作为与人类对齐的合成用户进行UI/UX评估
PerceptUI: LLM Agents as Human-Aligned Synthetic Users for UI/UX Evaluation
摘要
用户界面 (UI) 和用户体验 (UX) 评估是产品开发的核心,但可靠的反馈仍然依赖于招募人类参与者或运行在线 A/B 测试,这使得早期迭代缓慢且成本高昂。鉴于此,最近的工作探索了多模态大型语言模型作为代理评估器。然而,现有的方法要么产生表面的批评,要么产生反映模型自身偏见的判断,而不是特定用户的真实反应。我们引入了 PerceptUI,一个基于角色条件的 UI/UX 评估框架,可以预测特定用户将如何回答与界面相关的问题并产生自然语言的基本原理。 PerceptUI 分两个阶段进行训练:(i)对比反射微调通过从人类决策中提取经验教训来提炼教师生成的基本原理,以及(ii)从模型自身的失败痕迹中进行反射提示进化步骤。跨多个领域和数据集,PerceptUI 实现了人类水平的真实性,概括了未见过的问题和角色,并产生了人口水平的响应分布。
