论文
重新思考程序音频预训练:源缩放和目标适应
Rethinking Procedural Audio Pre-training: Source Scaling and Objective Adaptation
摘要
程序音频已成为可转移音频表示学习的可行来源,但其设计原理仍不清楚。我们重新审视两个问题:应如何缩放程序源,以及在自然音频上开发的训练选择是否应不变地转移到程序数据。使用受控源,我们将缩放分为公式类覆盖 C 和类内渲染多样性 I。FDSL 和 AudioMAE 的实验表明,这两种形式的缩放提供不同的好处,并且取决于学习公式和下游任务。一项匹配的 AudioMAE 研究进一步表明,程序音频倾向于低掩码比 (10%--25%),而 AudioSet-28K 则倾向于 50%--75%。共享码本分析揭示了程序音频中较低的补丁多样性和较强的时间可预测性。这些结果激发了源感知程序预训练,其中联合考虑源扩展和学习配置。代码可在 https://github.com/Cross-Innovation-Lab/Formula-Bank 获取。