论文

音频模仿器:使用音频参考控制 Video2Audio 合成中的音色和节奏

Audio Imitator: Controlling Timbre and Tempo in Video2Audio Synthesis with Audio Reference

应用与实践内容创作

摘要

视频到音频的生成在实现无声视频的语义一致性和时间对齐方面取得了重大进展。然而,音频包含丰富的风格属性,例如音色和节奏,仅从视觉和文本输入很难推断出这些属性。虽然参考音频可以用作附加调节,但它通常被视为整体信号,限制了细粒度的风格控制。我们提出了 AudioIM,这是一种属性感知框架,它明确地将音色和节奏建模为单独的控制因素,而不是依赖于整体提示调节。双编码器提取互补的音色相关和节奏相关的表示,这些表示通过全局调节注入。基于掩蔽的训练策略可以在推理时实现有效的潜在提示调节。 VGGSound 上的实验表明,风格相似度有所提高,同时保留了语义对齐和同步。音频样本可在以下网址获取:https://anonymousdemo757.github.io/。