论文

VideoVIBE:用于一次性交互式网站生成的基于视频的诊断基准

VideoVIBE: A Video-Grounded Diagnostic Benchmark for One-Shot Interactive Website Generation

模型评测基准与评测资源

摘要

自然语言驱动的“vibe 编码”能够一次性生成视觉丰富且交互式的 Web 应用程序,但对其质量的可靠评估却未能跟上步伐。现有的评估通常对孤立的工件或最终任务结果进行评分,提供关于发生哪些故障及其原因的有限证据。我们推出了 VideoVIBE,这是一种基于视频的基准测试,可将人工操作的网页录制转换为细粒度的诊断任务。它包含大约 1.7K 个诊断视频 QA 实例,这些实例源自生成的网页中 6,338 个经过验证的故障,涵盖语义逻辑、视觉运动、结构时间和功能故障。诊断主要基于记录的演示和行为,并使用网页源代码作为补充上下文。我们进一步提出了 V2Lens,这是一种 无需训练 循证多智能体系统,可通过有针对性的视觉和源代码验证来挑战并选择性地完善基于视频的初始诊断。在 13 个闭源和开源视频 MLLM 中,Gemini-2.5-Flash 是最强的独立模型,得分为 64.54,而 V2Lens 达到 71.72,提高了 7.18 分。总之,我们的结果表明,基于视频的评估可以超越孤立的工件,并将结果聚合到对生成的应用程序质量进行行为忠实且具有诊断信息的描述。