论文

KD-CVG:一种知识驱动的创意视频生成方法

KD-CVG: A Knowledge-Driven Approach for Creative Video Generation

应用与实践内容创作

摘要

创意生成(CG)利用生成模型自动生成突出产品功能的广告内容,一直是近期研究的重点。然而,虽然 CG 取得了相当大的进步,但大多数努力都集中在生成广告文本和图像上,而创意视频生成 (CVG) 的开发相对较少。这一差距主要是由于文本到视频(T2V)模型面临的两个主要挑战:(a)\textbf{语义对齐不明确},模型难以准确地将产品卖点与创意视频内容相关联;(b)\textbf{运动适应性不足},导致不切实际的运动和扭曲。为了应对这些挑战,我们开发了一个全面的广告创意知识库(ACKB)作为基础资源,并提出了一种知识驱动的方法(KD-CVG)来克服现有模型的知识限制。 KD-CVG 由两个主要模块组成:语义感知检索(SAR)和多模态知识参考(MKR)。 SAR 利用图注意力网络的语义意识和强化学习反馈来增强模型对卖点和创意视频之间联系的理解。在此基础上,MKR 将语义和运动先验融入到 T2V 模型中,以解决现有的知识差距。大量的实验证明了 KD-CVG 在实现语义对齐和运动适应性方面的卓越性能,验证了其相对于其他最先进方法的有效性。代码和数据集将在 https://kdcvg.github.io/KDCVG/ 上开源。