论文

来自 LLM 代理用户模拟的自动多模式用户体验改进建议

Automatic multimodal UX improvement recommendations from LLM agent user simulations

智能体系统Agent 架构与控制循环

摘要

通过用户测试评估实时网站的用户体验 (UX) 成本高昂、主观且难以扩展。 LLM 代理通过模拟真实的用户行为,提供了一条自动化 UX 测试的有前景的途径。然而,现有的模拟方法通常缺乏多模态,并且需要耗时的手动审查才能提取可行的见解。我们将来自模拟数据的用户体验改进建议形式化为结构化自然语言生成和排名问题,并使用专家注释和大语言模型作为法官建立评估协议。我们提出了 AMUSER,这是一个多模式框架,它可以模拟用户行为并根据结果数据自动生成优先的用户体验改进建议。我们在商业网站上对 AMUSER 进行了评估,结果表明,其建议大大优于纯文本模拟的建议(NDCG@3 = 0.758 与 0.359),且模拟成本降低了 89%。我们的结果表明多模态的不对称作用:模拟过程中的视觉访问通过更丰富的痕迹改进推荐,而在推荐生成过程中提供视觉输入会适度降低质量。我们还讨论了将 AMUSER 应用到商业网站的实际部署经验。