论文

视觉表示很重要:利用视频到音频生成中的时间差异

Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

应用与实践内容创作

摘要

视频到音频 (V2A) 生成通过引入为音频合成提供必要的时间线索的连续帧来扩展图像到音频生成 (I2A)。然而,现有的基于条件扩散的 V2A 方法通常通过额外的视听监督、声学结构预测或大型多模态模型推理来增强视觉条件,需要额外的网络或强归纳偏差。受视觉表征学习最新进展的启发,我们引入了 TD-V2A,它利用时间差异 (TD) 作为区分 V2A 和 I2A 的关键表征,以最小的架构修改来丰富视觉调节。我们首先在帧和特征级别上研究 TD,以确定 TD 补充视觉表示的最有效的表示级别。基于这些发现,我们开发了一种分层连续学习策略和一种退火时间差异指导方法,分别在扩散训练和采样过程中逐步学习和利用 TD 信息。对基准数据集的大量实验表明,通过我们提出的框架有效利用 TD 可以显着提高端到端 V2A 生成质量,甚至优于专用 V2A 表示(例如对比视听预训练)。