论文
AUV-Bench:用户界面的美学理解和生成评估
AUV-Bench: Aesthetic Understanding and Generation Evaluation for User Interfaces
摘要
多模态基础模型越来越多地用于评估和生成用户界面(UI),通常会产生看似合理的审美判断和视觉上合理的页面。然而,在专业设计审查下,他们的行为可能与人类设计师的行为有很大不同。在专业设计实践中,设计师依靠一套系统的美学原则来始终指导判断、诊断、修复和创作。因此,连贯的审美能力应该将审美判断与设计行为联系起来。然而,现有的评估通常是孤立地评估这些能力,因此很难确定任务级别的成功是否反映了共同的审美理解或仅仅是碎片化的特定任务能力。为了弥补这一差距,我们引入了 AUV-Bench,它与专业 UI 设计师合作开发,围绕 1,395 个可执行 Web 界面和四项任务:美学评分、诊断、修复和文本到 UI 生成。这些任务共享一组 UI 和美学原则,并在 660 个受控降解实例上进一步调整诊断和修复,以实现判断和行动的实例级分析。对 12 个模型的评估揭示了能力不平衡:模型在整体审美评分方面与专业设计师表现出中等程度的一致性,但精确诊断链的成功率最高仅为 24.7%。在一致的诊断-修复案例中,正确的判断和成功的修复并不总是一致的,暴露出识别美学问题和成功解决它们之间的判断-行动差距。在开放式一代中,即使是领先的模型在人类校准的评估下也只能达到中等的审美质量。总体而言,当前的模型表现出部分审美能力,但仍然缺乏可靠的 UI 设计所需的细粒度理解和判断动作连贯性。