论文

UniVidX:通过扩散先验生成多功能视频的统一多模态框架

UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors

模型训练预训练

摘要

最近的进展表明,视频扩散模型 (VDM) 可以重新用于各种多模式图形任务。然而,现有的方法通常为每个问题设置训练单独的模型,这固定了输入输出映射并限制了跨模态相关性的建模。我们推出 UniVidX,这是一个统一的多模式框架,它利用 VDM 先验来生成多功能视频。 UniVidX 将像素对齐任务制定为共享多模态空间中的条件生成,适应模态特定的分布,同时保留主干的原生先验,并在合成过程中促进跨模态一致性。它基于三个关键设计。随机条件屏蔽 (SCM) 在训练过程中将模态随机划分为干净条件和噪声目标,从而实现全向条件生成而不是固定映射。解耦门控 LoRA (DGL) 引入了按模态 LoRA,当模态作为生成目标时,LoRA 会被激活,从而保留 VDM 的强先验。跨模态自注意力(CMSA)跨模态共享键和值,同时保持特定模态的查询,促进信息交换和模态间对齐。我们在两个域中实例化 UniVidX:UniVid-Intrinsic,用于 RGB 视频和内在贴图,包括反照率、辐照度和法线; UniVid-Alpha,用于混合 RGB 视频及其组成的 RGBA 层。实验表明,这两种模型在不同任务中都实现了与最先进方法相媲美的性能,并且即使在少于 1,000 个视频上进行训练时,也能稳健地推广到野外场景。项目页面:https://houyuanchen111.github.io/UniVidX.github.io/