论文

SchemaGUI:用于可控 GUI 生成评估的模式驱动基准

SchemaGUI: A Schema-Driven Benchmark for Controllable GUI Generation Evaluation

模型评测基准与评测资源

摘要

大语言模型 (LLM) 在图形用户界面 (GUI) 生成方面展示了强大的潜力,但由于不受控制的数据分布、嘈杂的注释和有限的布局场景覆盖,可靠的评估仍然具有挑战性。为了解决这个问题,我们提出了 SchemaGUI,一个基于模板的基准,用于可控 GUI 生成评估。通过综合成对的自然语言指令和来自参数化接口模式的确定性函数调用引用,SchemaGUI 可以在几秒钟内生成数千个确定性注释任务,而无需人工标记。基于六个代表性双语场景中每种场景和语言的 1,000 个评估实例,我们对五种主流模型进行了基准测试,包括 Qwen3.5 系列、Qwen3-Coder-30B 和 DeepSeek-R1。我们的广泛分析揭示了三个关键见解。首先,精确的几何空间控制仍然是一个重要的瓶颈;虽然将 Qwen3.5 从 4B 缩放到 27B 将架构可行性从 91.56% 提高到 99.63%,但几何分数的提高幅度较小(从 67.05% 提高到 75.30%)。其次,生成难度对布局复杂性高度敏感,当前的 LLM 在简单的顺序排列方面表现出色,但在密集网格和多区域组合中遭受严重的坐标漂移。第三,思维模式会增加词元消耗,同时通常会降低 GUI 分数,特别是对于较小的模型。