论文
WebUIProof:UI智能体执行Harness评测WebUI代码生成
WebUIProof: Benchmarking WebUI Code Generators with UI-Agent Execution Harness
摘要
大规模评估WebUI代码生成很困难:输出可能编译通过且外观合理,却在用户交互下失败;既有基准大多依赖自由格式提示与静态检查(构建成功、截图),漏掉功能正确性。我们提出WebUIProof,一个面向执行的基准,为两类任务族提供结构化规格与稠密可执行交互测试:通用WebUI(仪表盘、游戏、交互工具)与3D交互仿真(粒子/星系系统、物理动力学)。WebUIProof包含UI智能体Harness,在无头浏览器中以迭代"计划-行动-观察"循环运行可执行交互测试:定位DOM元素、执行动作、观察UI/DOM变化并核验断言。我们在八个商用LLM上评估,观察到即使页面渲染成功,交互型需求仍频繁失败,3D仿真界面尤甚。最后我们展示UI智能体Harness可提供结果级训练信号:以可执行交互测试导出的RL奖励训练紧凑模型(Qwen2.5 14B与MIMO 7B)可提升功能完成度并减少构建失败。