论文
端到端音频模型中频率表示的结构瓶颈
Structural Bottlenecks on Frequency Representation in End-to-End Audio Models
摘要
端到端神经音频模型实现高保真压缩和生成。我们可能会将该性能视为它们直接代表可解释特征(例如音高和音色)的证据,但模型可以在不这样做的情况下产生合理的输出。模型可以在任何可达的基础上对这些特征进行编码,但无论哪种,这些特征都可以很好地描述为时频局部基元的组合。目前还不清楚最先进的编码器是否保留对这些原语的访问,从而保留对它们的组合的访问。通过理论分析和受控实验,我们表明,几种最先进的跨步卷积编码器在访问这些基元时施加了两个结构瓶颈,这两个瓶颈都可以从架构和信号结构中预测:(1)它们将基元折叠成别名等价类,建立了表示能力的界限;(2)它们限制了学习滤波器可用的频率分辨率,限制了可分离性。对于结构良好的数据,我们发现崩溃率为 31-35%,滤波器带宽比理论分辨率界限高出 10-35 倍,证实这两个瓶颈都是在实际信号条件下出现的。然后,我们引入 Gabor 潜在重构 (GLRF),这是一种轻量级的事后干预,可在频率局部化的基础上重新表达编码器潜在值,将滤波器带宽从理论分辨率范围的 10-35 倍减少到 1.5-3 倍,同时保持重建保真度并改善对音调等属性的控制。这些结果表明,所讨论的编码器可预见地降低对频率本地化基元的访问,从而纠缠依赖于它们的特征,并且轻量级、免重新训练的干预可以恢复大部分访问,从而提高可操纵性和可解释性。