论文

VAE 音频解码器的特征编码:输入、深度与分布

Feature Encoding in VAE-based Audio Decoders: Effects of Input, Depth and Distribution

模型评测模型行为与机制分析

摘要

像实时音频变分自动编码器(RAVE)这样的神经音频合成模型实现了令人印象深刻的生成质量,但它们的内部表示如何编码音乐特征仍然知之甚少。我们对在不同音乐领域训练的三个模型的 RAVE 解码器激活进行了系统的分层和跨层聚类分析,并使用四种刺激类型进行了测试。然后,我们使用通用 EnCodec 模型来评估架构泛化。对于 RAVE,我们发现合成刺激在模型和音频特征之间编码良好(音调 |\r{ho}|=0.45,零值的 5.1 倍,BPM |\r{ho}| = 0.76,零值的 8.6 倍)。当使用自然音频时,这些结果有所减少,但仍然很明显(特征平均值 |\r{ho}|=0.25,2.8x 空值)。当使用非线性 探针 时,自然音频会看到更强的编码(特征 R2=0.56 的平均值,零值的 18 倍,线性 探针 R2 的+0.152 非线性增益)。编码强度在解码器的各个层中各不相同,并且在所有音频特征中都可以看到中间层联合编码的能力增强(\b{eta}2 均为负,p < 0.05)。通用 EnCodec 解码器还可以在音频特征上看到类似的强合成响应、自然音频联合编码的类似非线性增益以及类似的深度配置文件。我们发现,与同一部分内的最佳整体层相比,最佳跨层簇提高了 BPM 编码的强度(r = 0.65,p = 0.006)和流行度(r = 0.75,p = 0.001),而对联合编码没有影响。这些发现提高了神经音频模型的可解释性,并为神经合成的目标控制策略提供了信息。

VAE 音频解码器的特征编码:输入、深度与分布:论文原图
图1:RAVE解码器架构图