论文

TASTE:用于人工智能生成图形设计的设计师注释的多维偏好数据集

TASTE: A Designer-Annotated Multi-Dimensional Preference Dataset for AI-Generated Graphic Design

模型评测基准与评测资源

摘要

文本到图像模型现在可以在生产规模上生成图形设计,但它们的监督仍然主要来自照片风格偏好数据集,每次比较都有一个总体结论。设计师沿着几个不同的轴(例如排版、布局、色彩和谐)评估设计,单个偏好标签会崩溃。我们发布了 \emph{TASTE} \textit{(版式、美学、空间、色调等)},这是一个多维偏好数据集,其中由五名专业设计师组成的两个不相交的群体,每个人都根据九个标准对四个当前文本到图像模型的输出以及每个图像的幻觉标志进行排名。我们将数据集与两个贡献配对。首先,基于 Kendall 的 $τ$、多数投票概率和针对精确独立同分布零点的孔多塞循环的与标准无关的信号验证框架;分析揭示了显着但适度的设计者一致性,每个 TASTE 标准都拒绝随机评估者无效。其次,我们在 TASTE 上对偏好模型进行基准测试,发现现成的 VLM 评委和专门的 T2I 评分员未能与设计小组达成多数协议,而直接在 TASTE 上训练的小型 MLP 头大大缩小了与单一评估者上限的差距,为未来 TASTE 训练的偏好模型设定了基线。