论文

PerceptUI:LLM智能体作为与人类对齐的合成用户进行UI/UX评估

PerceptUI: LLM Agents as Human-Aligned Synthetic Users for UI/UX Evaluation

模型训练监督微调与指令调优

摘要

用户界面 (UI) 和用户体验 (UX) 评估是产品开发的核心,但可靠的反馈仍然依赖于招募人类参与者或运行在线 A/B 测试,这使得早期迭代缓慢且成本高昂。鉴于此,最近的工作探索了多模态大型语言模型作为代理评估器。然而,现有的方法要么产生表面的批评,要么产生反映模型自身偏见的判断,而不是特定用户的真实反应。我们引入了 PerceptUI,一个基于角色条件的 UI/UX 评估框架,可以预测特定用户将如何回答与界面相关的问题并产生自然语言的基本原理。 PerceptUI 分两个阶段进行训练:(i)对比反射微调通过从人类决策中提取经验教训来提炼教师生成的基本原理,以及(ii)从模型自身的失败痕迹中进行反射提示进化步骤。跨多个领域和数据集,PerceptUI 实现了人类水平的真实性,概括了未见过的问题和角色,并产生了人口水平的响应分布。

PerceptUI:LLM智能体作为与人类对齐的合成用户进行UI/UX评估:论文配图
图 1:PerceptUI 概述,这是一个用于角色条件 UI/UX 评估的框架。