论文
从物理到表示:通过程序生成使用合成 预训练 进行音频学习
From Physics to Representation: Audio Learning with Synthetic Pre-training via Procedural Generation
摘要
自监督学习促进了多媒体分析的音频表示。然而,流行的以数据为中心的方法依赖于大量的现实世界语料库,增加了训练成本、管理负担和隐私障碍。为了解决这个问题,我们提出了 AudioPG,这是一个程序合成框架,消除了 预训练 期间的真实音频录制。 AudioPG 在根据基本声学基元和合成规则动态生成的波形上训练基于 Transformer 的屏蔽自动编码器。该编码器有效地转移到真实音频基准,在 ESC-50 上实现 90.60% 的准确度,在 FSD50K 上实现 0.546 mAP,在 UrbanSound8K 上实现 88.17%,在 Speech Commands V2 上实现 97.03%。值得注意的是,预训练 在单个 GPU 上可在 20 分钟内完成。潜在空间分析揭示了正交子空间中出现的物理因素,包括基频和相对强度,使表示可线性解码。当大规模语料库不可用时,这些结果将程序合成确立为高效、可解释的 预训练 信号。我们的代码位于:https://github.com/Freyliu0516/audioPG。