论文
AutoCut:基于多模态离散化和可控生成的端到端广告视频编辑
AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation
摘要
短视频已成为数字广告的主要媒体,需要可扩展且高效的内容创建。然而,当前的工作流程和人工智能工具仍然脱节且特定于模式,导致生产成本高、整体效率低。为了解决这个问题,我们提出了AutoCut,一种基于多模态离散化和可控编辑的端到端广告视频编辑框架。 AutoCut采用专用编码器提取视频和音频特征,然后应用残差矢量量化将它们离散化为与文本表示对齐的统一标记,构建共享的视频-音频-文本标记空间。在基础模型的基础上,我们通过组合多模态对齐和监督 微调 进一步开发了用于视频编辑的多模态 大语言模型,支持统一编辑框架内的视频选择和排序、脚本生成和背景音乐选择等任务。最后,完整的生产管道将预测的词元序列转换为可部署的长视频输出。对现实世界广告数据集的实验表明,AutoCut 降低了制作成本和迭代时间,同时大幅提高了一致性和可控性,为可扩展的视频创建铺平了道路。