论文

嵌入中还剩下多少音频?音频编码器的反演审计

How Much Audio Is Left In An Embedding? An Inversion Audit Of Audio Encoders

模型评测模型行为与机制分析安全与风险评测

摘要

预训练的音频编码器可重复用于下游任务,而这些任务在训练编码器时通常是未知的,因此它们的有用性部分取决于哪些信号属性能够在借口目标中幸存下来。我们通过配对源重建来研究这些保留的信息。使用共享的稳定音频开放潜在扩散解码器,我们根据监督分类器(VGGish、ConvNeXt)、音频文本对比模型(CLAP)和波形重建模型(EnCodec)产生的冻结表示重建五秒、44.1kHz 立体声音乐。这些物镜对保留光源细节施加了不同的压力,而它们暴露的界面在时间和光谱分辨率方面差异很大。通过对百万歌曲数据集 (MSD) 进行评估,我们发现编码器系列之间的可重构性存在明显差异,而在编码器比较中显示,当暴露更精细的时间或频谱结构时,恢复能力会得到改善。即使是压缩的面向任务的嵌入也支持保留可测量的源特异性和高水平音乐内容的重建。