论文

GEBench:将图像生成模型作为GUI环境进行基准测试

GEBench: Benchmarking Image Generation Models as GUI Environments

模型评测基准与评测资源

摘要

图像生成模型的最新进展,使其能够根据用户指令预测未来的图形用户界面(GUI)状态。然而,现有基准主要关注一般领域的视觉保真度,对GUI特定情境下状态转移与时间一致性的评估探索不足。为填补这一空白,我们提出GEBench,一个用于评估GUI生成中动态交互与时间一致性的综合基准。GEBench包含700个精心筛选的样本,横跨五个任务类别,既覆盖真实与虚构场景中的单步交互与多步轨迹,也包括grounding定位点的定位。为支持系统化评估,我们提出GE-Score,一个评估目标达成度、交互逻辑、内容一致性、UI合理性与视觉质量的新型五维指标。对当前模型的大量评估表明,它们在单步转移上表现良好,但在较长的交互序列上维持时间一致性与空间grounding时明显吃力。我们的发现指出,图标解读、文本渲染与定位精度是关键瓶颈。这项工作为系统化评估奠定了基础,并为未来构建高保真生成式GUI环境的研究提示了有前景的方向。代码发布于:https://github.com/stepfun-ai/GEBench。

GEBench:将图像生成模型作为GUI环境进行基准测试
图A1:GEBench评估框架概览。此图概述了GEBench框架的完整评估流程,该框架评估图像生成模型生成GUI序列的性能。