论文

HiDream-O1-Image:具有像素级统一的本机统一图像生成基础模型 Transformer

HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer

模型架构Transformer

摘要

视觉生成模型的发展长期以来一直受到依赖于不相交文本编码器和外部 VAE 的碎片化架构的限制。在本报告中,我们介绍了 HiDream-O1-Image,这是一种通过像素空间扩散 Transformer 的原生统一生成基础模型,它开创了从模块化架构到端到端上下文视觉生成引擎的范式转变。通过将原始图像像素、文本标记和特定于任务的条件映射到单个共享标记空间中,HiDream-O1-Image 在统一 Transformer (UiT) 架构内实现了多模态输入的结构统一。这种本机编码范例消除了对单独的 VAE 或不相交的预训练文本编码器的需求,允许模型将不同的生成和编辑任务视为一致的上下文推理过程。大量实验表明,HiDream-O1-Image 在各种生成任务中表现出色,包括文本到图像生成、基于指令的编辑和主题驱动的个性化。值得注意的是,仅使用 8B 参数,HiDream-O1-Image (8B) 就可以达到甚至超过参数明显更大的现有最先进模型(例如 27B Qwen-Image)的性能。至关重要的是,为了验证此范例的巨大可扩展性,我们成功地将架构扩展到超过 200B 参数。实验结果表明,这个大规模版本 HiDream-O1-Image-Pro (200B+) 解锁了前所未有的生成能力和卓越性能,建立了新的最先进基准。最终,HiDream-O1-Image 凸显了原生统一架构的巨大潜力,并为下一代多模式 AI 绘制了一条高度可扩展的路径。