论文
Dynin-Omni:全模态统一大扩散语言模型
Dynin-Omni: Omnimodal Unified Large Diffusion Language Model
摘要
我们推出了 Dynin-Omni,这是第一个基于掩模扩散的全模态基础模型,它将文本、图像和语音理解和生成以及视频理解统一在一个架构中。与序列化异构模态的自回归统一模型或需要与外部模态特定解码器进行编排的组合统一模型不同,Dynin-Omni 本身将全模态建模制定为共享离散词元空间上的屏蔽扩散,从而在双向上下文下实现迭代细化。 Dynin-Omni 采用多阶段训练策略,具有基于模型合并的模态扩展和全模态对齐。我们通过 19 个多模态基准评估 Dynin-Omni,涵盖语言推理、图像生成和编辑、视频理解以及语音识别和合成。 Dynin-Omni 在 GSM8K 上获得 87.6,在 MME-P 上获得 1733.6,在 VideoMME 上获得 61.4,在 GenEval 上获得 0.87,在 LibriSpeech 测试清理上获得 2.1 WER,始终优于现有的开源统一模型,同时与强大的特定模态专家系统保持竞争力。这些结果证明了掩蔽扩散作为任意建模的统一范例的潜力,为实时全模态系统、统一的跨模态检索和生成以及具身多模态智能体提供了灵活的基础。