论文
Wan-Image:突破生成视觉智能的界限
Wan-Image: Pushing the Boundaries of Generative Visual Intelligence
摘要
我们推出了 Wan-Image,这是一个统一的视觉生成系统,专门设计用于将图像生成模型从休闲合成器转变为专业级生产力工具。虽然当代扩散模型在美学生成方面表现出色,但它们经常在严格的设计工作流程中遇到关键瓶颈,需要绝对的可控性、复杂的版式渲染和严格的身份保留。为了应对这些挑战,Wan-Image 通过将 大语言模型 的认知能力与扩散 Transformer 的高保真像素合成相结合,采用原生统一的多模态架构,将高度细致的用户意图无缝地转化为精确的视觉输出。它从根本上由大规模多模态数据扩展、系统化的细粒度注释引擎和精选的强化学习数据提供支持,以超越基本的指令遵循并解锁专家级的专业能力。其中包括超长复杂文本渲染、超多样化肖像生成、调色板引导生成、多主体身份保存、连贯顺序视觉生成、精确多模态交互式编辑、原生 Alpha 通道生成和高效 4K 合成。在各种人类评估中,Wan-Image 的整体性能超过了 Seedream 5.0 Lite 和 GPT Image 1.5,在挑战性任务中达到了与 Nano Banana Pro 相当的水平。最终,Wan-Image 彻底改变了电子商务、娱乐、教育和个人生产力领域的视觉内容创作,重新定义了专业视觉合成的界限。