论文

Mamoda2.5:利用 DiT-MoE 增强统一多模式模型

Mamoda2.5: Enhancing Unified Multimodal Model with DiT-MoE

摘要

我们推出了 Mamoda2.5,这是一个统一的 AR-Diffusion 框架,可将多模态理解和生成无缝集成到单一架构中。为了有效增强模型的生成能力,我们为Diffusion Transformer骨干网配备了细粒度专家混合(MoE)设计(128位专家,Top-8路由),生成仅激活3B参数的25B参数模型,在扩大模型容量的同时显着降低了训练成本。 Mamoda2.5在VBench 2.0上实现了顶级一代性能,并创下了视频编辑质量的新记录,超越了经过评估的开源模型,并与当前顶级专有模型(包括OpenVE-Bench上的Kling O1)的性能相匹配。此外,我们引入了联合少步 蒸馏 和强化学习框架,将 30 步编辑模型压缩为 4 步模型,大大加速了模型推理。与开源基线相比,Mamoda2.5 的视频编辑推理速度提高了 95.9倍。在实际应用中,Mamoda2.5已成功部署用于广告场景中的内容审核和创意修复任务,在内部广告视频编辑场景中实现了98%的成功率。