论文
LLaDA2.0-Uni:通过扩散统一多模态理解和生成 大语言模型
LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model
摘要
我们推出了 LLaDA2.0-Uni,这是一种统一的离散扩散 大语言模型 (dLLM),支持在本机集成框架内进行多模态理解和生成。其架构结合了完全语义离散分词器、基于 MoE 的 dLLM 主干和扩散解码器。通过 SigLIP-VQ 离散化连续视觉输入,该模型能够在主干内实现文本和视觉输入的块级掩模扩散,同时解码器将视觉标记重建为高保真图像。通过主干中的前缀感知优化和解码器中的少步 蒸馏,推理效率得到了超越并行解码的增强。在精心策划的大规模数据和定制的多阶段训练管道的支持下,LLaDA2.0-Uni 在多模态理解方面匹配专业的 VLM,同时在图像生成和编辑方面提供强大的性能。它对交错生成和推理的原生支持为下一代统一基础模型建立了一个有前景且可扩展的范例。代码和模型可在 https://github.com/inclusionAI/LLaDA2.0-Uni 获取。