论文
Cookie-Bench:面向Web生成的持续屏幕关键交互评估
Cookie-Bench: Continuous On-screen Key Interaction Evaluation for Web Generation
摘要
前端Web代码已成为每个前沿LLM发布的核心产品界面,但以开发速度评估这些交互式应用仍然代价高昂,因为Arena等由人工评判的排行榜无法规模化。现有的自动化替代方案通常依赖参考实现、测试套件或僵化的检查清单,往往无法捕捉人类评审员在实时会话中所做的有理据的综合判断。我们提出一种同时具备无参考、自主驱动与整体式推理特征的新评估范式,并通过两个成果物将其具体化。Cookie-Bench是一个含11个领域、54个叶子节点、1,000条查询的WebDev基准,同时涵盖静态展示与交互应用任务,在三个难度层级与三个目标语言组之间保持均衡,任务简报经过改写以抵抗对流传提示词的记忆复现。COOKIE以Flavell的元认知监测理论为基础,将证据积累与判断分离为三个阶段:静态感知(Static Perception)通过被动观察形成第一印象;智能体驱动交互(Agent-Driven Interaction)在自主探索应用的同时持续采集屏幕视频、音频与逐步截图;动态评分(Dynamic Scoring)仅在证据链完整后才给出整体的功能与美学判定,并附结构化的失败归因。在Cookie-Bench上,COOKIE与专家人工评分高度一致,同时揭示出13个前沿LLM在交互式Web生成上仍有巨大提升空间。 https://anonymous.4open.science/r/Cookie-3CE/
