论文
根据图像描述提示对前沿文本到图像模型进行基准测试
Benchmarking Frontier Text-to-Image Models on Image-Description Prompts
摘要
文本到图像模型通常在平均情况提示下报告,这低估了系统之间在组合要求较高的请求上的差距,这些请求涉及精确的对象计数、多对象属性绑定、清晰的嵌入文本和显式的空间约束。我们评估了四种生产文本到图像的系统:Hunyuan 3.0、Gemini 3 Pro Image(“Nano Banana Pro”)、Black Forest Labs FLUX.2 和 Ideogram 3.0。该评估使用从 DataSeeds.AI 样本数据集 (DSD) 中提取的 48 个最难的提示,这些提示是通过对整个语料库进行自动复杂性评分来选择的。每张生成的图像均使用独立评审的评分标准进行评分。 GPT-5.4-Pro 编写了原子、加权、互斥和集体详尽 (MECE) 评估标准,而 Gemini 3.1 Pro Preview 则独立确定是否满足每个标准。 Gemini 3 Pro Image以84.8/100的成绩排名第一,以微弱优势领先于FLUX.2的82.3/100。表意文字3.0和混元3.0得分分别为65.7/100和63.3/100。故障分析表明,领先的系统主要通过对象错误计数和几何伪影而失分,而落后的系统更频繁地产生乱码。表意文字 3.0 也经常省略所要求的元素。作者可根据要求提供完整的每个样本的评分标准、分数和失败注释。