论文

LongWebBench:长程设定下结构性与功能性网页生成评估

LongWebBench: Evaluating Structural and Functional Webpage Generation in Long-Horizon Settings

模型评测智能体系统Agent任务评测基准与评测资源长程任务评测

摘要

近期视觉语言模型(VLM)在从视觉输入生成网页上展现有前景的进展——但既有评估主要聚焦短的、单屏、大体静态的网页。我们介绍LongWebBench——从结构与功能两个视角评估长程网页生成的基准。LongWebBench含490个真实长网页用于结构保真评估——以及129个网页上507个目标导向交互任务用于功能评估。它采用两个互补协议:评估长程结构连贯性的多维基于VLM的指标——以及端到端功能验证的DOM增广基于智能体的管线。我们进一步经人类一致性分析检验自动评估协议。单图与多图设定下SOTA开源与专有VLM的实验揭示:结构保真随网页长度增加而退化——而视觉上貌似合理的生成常无法支持可执行的多步交互。这些结果凸显:长网页生成评估需要超越视觉相似性——以可执行交互为核心标准。代码与数据见 https://github.com/zheny2751-dotcom/LongWebBench。

LongWebBench:长程设定下结构性与功能性网页生成评估:论文配图
图 1:LongWebBench 的动机。现有的评估主要考虑有限视图重建或孤立交互,而LongWebBench则通过结构保真度和任务级功能验证来评估长网页。单图像设置下的实证结果表明,当前的 VLM 在远程视觉重建和可执行任务完成方面仍然面临挑战。