论文

MMAudio-LABEL:通过音频生成为无声视频添加音频事件标签

MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video

应用与实践内容创作

摘要

多模式生成的最新进展使得能够从无声视频生成高质量音频。实际应用(例如声音制作)不仅需要生成的音频,还需要明确的声音事件标签,详细说明声音的类型和时间。一种简单的方法是将标准声音事件检测应用于生成的音频。然而,这种事后管道本质上是有限的,因为它很容易出现错误累积。为了解决这一限制,我们提出了 MMAudio-LABEL(基于 LAtent 的事件标签),这是一种基于基础音频生成模型作为骨干的事件感知音频生成框架,可从无声视频中联合生成音频和帧对齐的声音事件预测。我们在 Greatest Hits 数据集上评估我们的方法,用于起始点检测和 17 类材料分类。与基线相比,我们的方法将起始检测准确度从 46.7% 提高到 75.0%,将材料分类准确度从 40.6% 提高到 61.0%。这些结果表明,联合学习音频生成和事件预测可以实现更具可解释性和实用性的视频音频合成。