论文
UI2App:可执行 Web 应用程序生成中视觉交互推理的基准测试
UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation
摘要
大语言模型 (LLM) 在网页生成方面表现出了不断增长的能力。然而,现有的文本驱动方法依赖于复杂的提示,这对用户提出了很高的要求,并且为页面布局和跨页面视觉连贯性提供了有限的表达能力。图像驱动范例以 UI 屏幕截图作为输入,与真实的开发工作流程更加一致。然而,当前的基准主要关注视觉保真度,缺乏对生成的工件中的交互能力的系统评估。为了解决这一差距,我们引入了 UI2App,这是第一个针对交互推理的基准测试,能够仅从屏幕截图恢复应用程序行为,而无需任何文本或行为指导。 UI2App 包含 327 个屏幕截图,分为 45 个状态一致的屏幕截图集,用于可运行的多路由 Web 应用程序。我们设计了一个端到端的管道,从四个维度评估每个工件:可执行性、导航可达性、视觉保真度和交互推理。交互度量 (IIS) 通过功能正确性和状态管理复杂性来评估推断的交互,归功于任何有效的实现而不是匹配单个参考。对六种前沿视觉语言模型的实验揭示了视觉重建和交互实现之间明显的能力不匹配:视觉保真度领先者在 IIS 上的得分仅为 7.5,排名第四,落后 IIS 领先者 5.2 倍。高复杂性的交互(例如跨页面状态)仍然是一个普遍的瓶颈,一半的评估模型在这个维度上的得分恰好为零。总体而言,结果表明从静态屏幕截图推断完整的交互行为仍然是模型的关键挑战。