论文

Uni-ViGU:通过基于扩散的视频生成器实现统一视频生成和理解

Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator

应用与实践内容创作

摘要

集成视觉理解和生成的统一多模态模型面临着一个根本性的挑战:视觉生成比理解产生更高的计算成本,特别是对于视频。这种不平衡促使我们颠覆传统范式:我们提出了 Uni-ViGU,一种通过扩展视频生成器作为基础来统一视频生成和理解的框架,而不是扩展以理解为中心的 MLLM 来支持生成。我们引入了一种统一的流方法,可以在单个进程中执行视频的连续流匹配和文本的离散流匹配,从而实现连贯的多模态生成。我们进一步提出了一种基于 MoE 的模态驱动框架,该框架通过轻量级层增强 Transformer 块以进行文本生成,同时保留生成先验。为了重新利用生成知识来促进理解,我们设计了一种包含两个阶段的双向训练机制:知识召回重建输入提示以利用学习的文本视频对应关系,而能力细化则对详细视频描述进行微调以建立有区别的共享表示。实验表明,Uni-ViGU 在视频生成和理解方面实现了具有竞争力的性能,验证了以生成为中心的架构是实现统一多模态智能的可扩展路径。项目页面和代码:https://fr0zencrane.github.io/uni-vigu-page/。