论文
Graphic-Design-Bench:评估人工智能在图形设计任务上的综合基准
Graphic-Design-Bench: A Comprehensive Benchmark for Evaluating AI on Graphic Design Tasks
摘要
我们推出 GraphicDesignBench (GDB),这是第一个综合基准测试套件,专门用于在专业图形设计任务的各个方面评估 AI 模型。与专注于自然图像理解或通用文本到图像合成的现有基准不同,GDB 针对专业设计工作的独特挑战:将交流意图转化为结构化布局、渲染印刷忠实的文本、操纵分层构图、生成有效的矢量图形以及动画推理。该套件包含沿五个轴组织的 50 个任务:布局、版式、信息图表、模板和设计语义以及动画,每个任务都在理解和生成设置下进行评估,并基于从 LICA 分层组合数据集提取的现实世界设计模板。我们使用标准化的度量分类法评估一组前沿闭源模型,涵盖空间准确性、感知质量、文本保真度、语义对齐和结构有效性。我们的结果表明,当前的模型无法应对专业设计的核心挑战:复杂布局的空间推理、忠实的矢量代码生成、细粒度的排版感知以及动画的时间分解在很大程度上仍未解决。虽然高级语义理解是可以实现的,但随着任务要求精度、结构和组合意识,差距急剧扩大。 GDB 提供了一个严格的、可重复的测试平台,用于跟踪人工智能系统的进展,这些系统可以充当有能力的设计协作者。完整的评估框架是公开的。