论文

Vision2Web:带有代理验证的视觉网站开发的分层基准

Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verification

智能体系统Agent任务评测

摘要

大语言模型 的最新进展提高了 编码智能体 的功能,但复杂的端到端网站开发的系统评估仍然有限。为了解决这一差距,我们引入了 Vision2Web,这是一个视觉网站开发的分层基准,涵盖从静态 UI 到代码生成、交互式多页面前端再现,到长期全栈网站开发。该基准测试根据真实网站构建,包含 16 个类别的 193 项任务、918 张原型图像和 1,255 个测试用例。为了支持灵活、彻底和可靠的评估,我们提出了基于工作流的代理验证范例,该范例基于两个互补组件:GUI智能体 验证器和基于 VLM 的判断器。我们评估了在不同编码代理框架下实例化的多个视觉语言模型,揭示了所有任务级别上的巨大性能差距,而最先进的模型仍在全栈开发上苦苦挣扎。