论文
WebRISE:针对 MLLM 生成的 Web 工件的需求诱导状态评估
WebRISE: Requirement-Induced State Evaluation for MLLM-Generated Web Artifacts
摘要
MLLM 生成的 Web 工件的现有基准通过本地证据评估交互,并错过了确定页面是否有效的需求引发的状态和转换。我们引入了 WebRISE,它将任务需求编译成可观察状态、用户意图转换和 DOM/视觉断言的交互契约图 (ICG),以实现与实现无关的浏览器执行。 WebRISE 跨越五种输入模式(文本、Markdown、草图、图像、视频)的 442 个任务,具有 5,495 个转换和 5,271 个需求检查,将用户声明的功能与隐式产品级约束分开。在 14 个 MLLM 中,即使是最强的模型也只能达到 65.6% 的转换有效性和 66.3% 的需求覆盖率,并且视觉质量并不能代表行为(Markdown 上的 Qwen3.6-35B-A3B:V=80.8 但 T=15.5)。视频提供了最强的交互信号(文本隐式覆盖率+10.6 pp),而隐式约束仍然存在;缺陷注入显示,基于 ICG 的评分检测状态错误的速度是检查点式评估的 2-16 倍。