论文
LongWebBench:长程设定下结构性与功能性网页生成评估
LongWebBench: Evaluating Structural and Functional Webpage Generation in Long-Horizon Settings
摘要
近期视觉语言模型(VLM)在从视觉输入生成网页上展现有前景的进展——但既有评估主要聚焦短的、单屏、大体静态的网页。我们介绍LongWebBench——从结构与功能两个视角评估长程网页生成的基准。LongWebBench含490个真实长网页用于结构保真评估——以及129个网页上507个目标导向交互任务用于功能评估。它采用两个互补协议:评估长程结构连贯性的多维基于VLM的指标——以及端到端功能验证的DOM增广基于智能体的管线。我们进一步经人类一致性分析检验自动评估协议。单图与多图设定下SOTA开源与专有VLM的实验揭示:结构保真随网页长度增加而退化——而视觉上貌似合理的生成常无法支持可执行的多步交互。这些结果凸显:长网页生成评估需要超越视觉相似性——以可执行交互为核心标准。代码与数据见 https://github.com/zheny2751-dotcom/LongWebBench。
