论文

分身:声音效果及其合成双胞胎

Doppelganger: Sound Effects and Their Synthetic Twins

模型评测基准与评测资源

摘要

音频调节生成器现在可以从真实录音中产生合成声音效果,因此事件的真实版本和合成版本越来越多地共存于声音库和用于训练音频模型的语料库中,但没有基准衡量表示是否可以将合成剪辑与其生成的特定真实录音相匹配。我介绍了 Doppelganger,这是跨合成真实边界匹配音效的基准,将 34 个日常声音事件中的 10,420 个真实剪辑与一个经过音频调节的合成双胞胎以及受控的 7 类语料库配对。现成的音频编码器不能干净地跨越边界。让嵌入忽略边界的标准方式——在声音事件标签上训练它——对熟悉的声音有效,但对新的声音会适得其反,低于未经训练的编码器。相反,对成对的训练——一个剪辑和它自己的合成双胞胎——进行概括。对于未经训练的声音事件,它在大约 80% 的时间内恢复了确切的真实来源(高于未经训练的 61%;机会为 0.03%),而没有任何目标能够有意义地提高对那些未见事件的类别级别识别。学习到的匹配特定于一个生成器 - 它可以在该生成器设置的更改中幸存下来,但不能切换到不同的生成器,并且对于测试的纯文本生成器来说会崩溃。在相同试验中,人工注释基线(49 名听众)远高于随机值,但低于模型。合成双胞胎在大约 29% 的情况下会欺骗人们,让他们认为它们是真实的,但发生器专用的探测器可以将这些经过音频处理的双胞胎与真实录音完美地分开。