论文

UIBenchKit:用于设计到代码模型评估的统一工具包

UIBenchKit: A unified toolkit for design-to-code model evaluation

模型评测基准与评测资源

摘要

近年来,在自动设计到代码生成方面取得了实质性进展,提出了许多从网页屏幕截图生成 HTML 和 CSS 的方法。然而,缺乏标准化的评估平台使得很难公平地比较这些方法,限制了实际采用和系统研究进展。为了弥补这一差距,我们引入了 UIBenchKit,这是一个开源集成工具包,旨在统一设计到代码任务的评估。 UIBenchKit 抽象了环境设置、模型推理和代码渲染的复杂性,为研究人员提供了一个即插即用的架构,可以在一致的设置下比较各种方法。此外,它还提供了一个分析界面,用于跨多个指标进行比较。使用 UIBenchKit,我们对现有工具进行了基准测试研究,并得出了一些研究结果,突出了未来改进的方向。通过为实验和评估提供简化的环境,UIBenchKit 旨在加速网络工程的未来基准测试和创新。评估平台和工具包可在项目页面 https://www.uibenchkit.com/ 获取。