论文

VISTA:视觉规范到 Web 应用程序的端到端基准 编码智能体

VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents

智能体系统Agent任务评测

摘要

我们提出了 VISTA(视觉规范到应用程序基准),这是一个用于评估基于 LLM 的代理的端到端 Web 应用程序生成能力的基准。与之前专注于算法任务的代码生成基准不同,VISTA 的目标是现实的以 UI 为中心的开发,其中代理必须根据未指定的输入生成功能性的、视觉上一致的应用程序。我们定义了沿两个轴、视觉/结构保真度和堆栈约束变化的五种提示信息条件:(1)仅具有自由堆栈选择的文本,(2)在三个指定堆栈下具有参考屏幕截图的文本,(3)在自由堆栈选择下具有参考屏幕截图的文本,(4)在单个指定堆栈下具有屏幕截图和修剪的Figma结构的文本,以及(5)在自由堆栈选择下具有屏幕截图和修剪的Figma结构的文本。为了实现稳健的评估,基准测试中的每个页面都使用交互式 UI 组件和三个视觉锚点手动注释,解决了基于脚本的测试工具(例如 Playwright)在开放式代码生成设置中的众所周知的局限性。评估结合了基于 DOM 的参考匹配、特定行为的浏览器测试和基于 CLIP 的视觉相似性,共同测量结构对齐、行为完整性和整体视觉保真度。我们使用 VISTA 评估了来自两个模型系列和两个Harness的四个智能体系统,发现视觉保真度和功能正确性在输入条件和智能体之间部分解耦,并且智能体编辑风格变化很大,但在很大程度上与任务质量正交。 VISTA 为推进基于代理的软件工程研究奠定了严格且可重复的基础。代码可在 https://github.com/kaboider/VISTA_Bench 获取。