论文

Qwen-Image-Bench:文本到图像评估从生成到创造

Qwen-Image-Bench: From Generation to Creation in Text-to-Image Evaluation

模型评测基准与评测资源

摘要

文字转图像生成已经从基本的图像合成发展成为专业创意工作流程中常用的核心能力,简单的文字图像对齐已经不能满足用户真实重建真实世界和真实创意表达的迫切需求。然而,现有的基准仍然以这些基本标准为基础,尚未捕捉到真正的艺术实践中重要的微妙功能,因此很难可靠地区分最先进的 T2I 模型。为了解决这一差距,我们推出了 Qwen-Image-Bench,这是一个以创作者为中心的基准测试,与专业艺术家共同设计,并立足于现实世界的创作场景。 Qwen-Image-Bench 通过两个应用程序驱动的维度丰富了传统评估:现实世界保真度和创意生成。借鉴专业艺术工作流程中固有的阶段性推理,我们将这五个支柱组织成一个自上而下的分层分类法,进一步分解为 23 个二级子功能和 56 个三级可验证的规则。为了确保广泛的覆盖范围,我们策划了 1000 个分层提示,每个提示都跨多个支柱联合运用四个以上的细粒度方面。我们基于 Qwen3.6-27B 训练了一个统一的评判模型 Q-Judger,由来自全球艺术院校的 80 名专业注释者根据盲标记和三重审查协议进行监督,对所有 56 个可验证方面的每张图像进行评分,产生细粒度、基于标题和完全可归因的诊断,而不是单一的不透明分数。根据经验,Qwen-Image-Bench 可靠地区分了领先的 T2I 模型,在现实世界保真度和创意生成这两个应用程序驱动的维度上实现了最大的分离,而现有基准几乎无法提供洞察力,同时还为生产级 T2I 开发提供了值得信赖的优化信号。