论文

超越文本条件:用于视频生成的 MLLM-DiT 融合的系统研究

Beyond Text Conditioning: A Systematic Study of MLLM-DiT Fusion for Video Generation

模型架构混合架构

摘要

Diffusion Transformer (DiTs) 已成为高保真视频生成的主导范例,但其执行高级语义规划的能力仍然有限。虽然将 MLLM 与扩散主干相集成的混合架构在图像合成方面显示出强大的优势,但此类设计在视频生成方面仍未得到充分探索,现有方法通常将 MLLM 主要视为冻结特征编码器而不是语义生成器。为了填补这一空白,我们通过回答三个问题来系统地研究 MLLM 应如何与 DiT 集成以进行视频生成:什么中间表示应桥接 MLLM 和 DiT,MLLM 应如何生成它,以及 DiT 应如何在扩散渲染期间合并它。我们的分析揭示了三个关键发现:(1) 基于 EMA 的标记生成器生成的离散语义视觉标记提供了稳定且富有表现力的界面,(2) 自回归因果模型对于生成这些标记是有效的,(3) 显式视觉标记调节比即时细化或潜在桥接更有效。基于这些发现,我们提出了 BiVidGen,这是一种混合框架,其中 MLLM 首先生成语义视觉标记,而 DiT 通过多层交叉注意力渲染以文本和这些标记为条件的视频。大量实验表明,BiVidGen 在微调的 DiT 基线上提高了语义对齐和时间连贯性,在 VBench-Long 上实现了更强的性能。这些结果表明,基于 MLLM 的显式视觉规划为文本到视频的生成(超越纯文本调节)提供了有效的中间接口。