论文

定位、分离和增强:音频混合的完全生成方法

Spot, Separate, and Enhance: Fully Generative Approach for Audio Mixing

应用与实践内容创作

摘要

我们推出了 Spot、Separate 和 Enhance (SSE),这是第一个用于音频重新混合和增强的多模式、用户引导生成模型。 SSE 在视频和文本描述的指导下,通过重新平衡音频、删除不需要的音频源以及减少混响来增强视频内容。为了支持其训练和评估,我们提出了 DegradedMix,这是一个基于音频混音基准 MuddyMix 构建的新数据集。我们还采用生成建模的评估指标,与标准的基于重建的指标相比,它可以更好地捕捉混音的创造性本质。大量实验表明,SSE 在可控性和混音质量方面均优于现有基线。项目页面:此 https URL