论文

DreamX-Creator:使 2K 分辨率的原生音频视频生成大众化

DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

应用与实践内容创作

摘要

最近的视频生成器经常省略音频或在单独的阶段中合成音频,从而限制了视觉动态和声学事件的相互建模。我们推出了 DreamX-Creator 1.0,这是一个以 7B 发生器为中心的紧凑型原生联合音视频生成系统。以第一帧和文本提示为条件,生成器联合对模态专用音频和视频流进行去噪。流在网络的前半部分独立处理,并在后半部分通过门控跨模态注意力耦合,其词元和头部输出门调制每个活动的跨模态注意力头部输出。统一的音频-视频数据系统构建和过滤时间相干的剪辑,生成结构化的多模式注释,并将剪辑组织到面向能力的数据池中。渐进式联合训练包括两个音频-视频 预训练 阶段,然后是高质量微调。音频视频强化学习通过模态感知多模态反馈进一步对生成器进行后训练,将视频、音频和跨模态反馈路由到相应的流。对于高分辨率输出,我们的自回归 1 步 2K 细化流程将双向多步教师调整为自回归多步细化器,并将其提炼为需要每个时间块进行一次去噪评估的学生。总体而言,DreamX-Creator 1.0 实现了原生同步音频视频生成,其性能可与最先进的开源系统相媲美。通过发布紧凑型 7B 生成器和 2K Refiner,我们寻求使原生音频-视频生成民主化,并为统一音频-视频生成建模的未来研究提供可访问的基础。