论文
Bernini:视频传播的潜在语义规划
Bernini: Latent Semantic Planning for Video Diffusion
摘要
多模态 大语言模型 (MLLM) 和扩散模型均已达到显着的成熟度:MLLM 擅长对具有强大语义基础的异构多模态输入进行推理,而扩散模型则以逼真的保真度合成图像和视频。我们认为这两个系列可以通过简单的分工来统一:MLLM 执行语义规划,而扩散模型则根据高级语义指导和低级视觉特征渲染像素。基于这个想法,我们提出了 Bernini,一个用于视频生成和编辑的统一框架。基于 MLLM 的规划器直接在 ViT 嵌入空间中预测目标语义表示,基于 DiT 的渲染器合成以此规划为条件的像素,并通过文本特征进行增强,并通过编辑源 VAE 特征来保留细节。由于语义充当接口,因此规划器和渲染器可以单独训练,并且仅进行轻微的联合训练,从而保留两个组件的预训练优势,同时保持训练效率。为了更好地处理多个视觉输入,我们引入了分段感知 3D 旋转位置嵌入 (SA-3D RoPE),并进一步将思想链推理纳入规划器中,以更好地将理解转化为生成。 Bernini 在各种视频生成和编辑基准中实现了最先进的性能,MLLM 的预训练理解转化为对具有挑战性的编辑任务的强大概括。