论文

Qwen-Image-2.0技术报告

Qwen-Image-2.0 Technical Report

模型架构混合架构

摘要

我们推出了 Qwen-Image-2.0,这是一种全能图像生成基础模型,它将高保真生成和精确图像编辑统一在一个框架内。尽管最近取得了进展,现有模型仍然在超长文本渲染、多语言排版、高分辨率真实感、强大的指令跟踪和高效部署方面遇到困难,特别是在文本丰富且构图复杂的场景中。 Qwen-Image-2.0 通过将 Qwen3-VL 作为条件编码器与多模态扩散 Transformer 相结合来解决这些挑战,以进行联合条件目标建模,并得到大规模数据管理和定制的多阶段训练管道的支持。这可以实现强大的多模式理解,同时保留灵活的生成和编辑功能。该模型支持多达 1K 个词元的指令,用于生成幻灯片、海报、信息图表和漫画等丰富文本的内容,同时显着提高多语言文本保真度和版式。它还通过更丰富的细节、更真实的纹理和连贯的照明来增强照片级真实感生成,并在不同的风格中更可靠地遵循复杂的提示。广泛的人类评估表明,Qwen-Image-2.0 在生成和编辑方面都大大优于之前的 Qwen-Image 模型,标志着向更通用、可靠和实用的图像生成基础模型迈出了一步。