论文

Kandinsky 6.0 视频:同步视频和音频生成的基础模型

Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation

模型架构混合架构

摘要

我们推出 Kandinsky 6.0 Video,这是一个用于同步文本到音频视频生成的基础扩散模型系列,包括 Kandinsky 6.0 Video Lite (3B 参数) 和 Kandinsky 6.0 Video Pro (29B 参数)。两种型号均可在文本转音频视频 (T2AV) 和图像转音频视频 (I2AV) 模式下生成带有同步 44 kHz 音频(包括口型同步)的 5 秒视频剪辑;内置超分辨率模型将输出分辨率提高到全高清 (1920$\times$1080)。 Kandinsky 6.0 Video 基于 Kandinsky 5.0 的视频生成功能,采用双流 CrossDiT 架构,通过双向交叉注意力连接预训练的视频流和新训练的音频流,以实现时间和语义对齐。我们的连续预训练策略首先在大规模音频语料库上从头开始训练音频流,然后在成对的音频-视频数据上联合训练两个流,同时保持单峰保真度;预训练之后是有监督的微调、基于强化学习的后训练和蒸馏。在并行人类评估中,Kandinsky 6.0 Video Pro 明显优于其前身 Kandinsky 5.0 Video Pro,并且与领先的音视频生成模型保持竞争力,特别是在语音质量方面。为了加速多媒体生成的开放研究和部署,我们在 MIT 许可下发布了代码、模型检查点和扩散器集成。

Kandinsky 6.0 视频:同步视频和音频生成的基础模型的原论文方法或结果图
图 3:SR-DiT 架构。噪声视频潜在、第一帧 HQ 锚点和二进制锚点掩码沿通道维度连接,并由时间步长调制的 DiT 块进行处理。输出头预测流量匹配速度。该模型无需文本条件即可运行。