论文
CineDance:迈向下一代多镜头长格式电影音频视频生成
CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video Generation
摘要
训练数据集的保真度和结构多样性从根本上决定了视频生成模型的能力。尽管商业系统显示出生成电影叙事的卓越能力,但开源模型的进展仍然受到高质量训练数据稀缺的限制。为了弥补这一差距,我们引入了 CineDance-1M,这是一个大规模、开放研究的文本到音频视频 (T2AV) 数据集,专为多镜头、长格式联合音频视频生成而设计。每个视频平均 92.8 秒和 24.2 个连续镜头,它为音频和视频模式提供可配置的结构化注释。这种卓越的品质是通过严格的三阶段管理流程实现的:i)多样化来源和全面清理,ii)受电影理论启发的叙事解析,以及 iii)分层双模式字幕。为了进行全面评估,我们建议使用 CineBench,它具有多样化的提示套件和专为复杂的叙事音视频评估而定制的六维、人性化的度量系统。此外,我们将 LTX-2.3 融入到 CineDance 中,展示了卓越的单模态质量、精确的音视频对齐以及强大的主题和环境一致性,有效验证了我们的策展策略和 CineDance-1M 的高质量。我们预计这项工作将为加速未来多镜头、长格式联合音视频生成的研究奠定坚实的基础。我们的项目页面位于 https://aliothchen.github.io/projects/CineDance/。