论文

探索 CLAP 音频嵌入中的底层声学属性编码

Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings

模型评测模型行为与机制分析

摘要

音频基础模型被广泛采用作为通用特征提取器,但其学习表示的内部结构仍然没有得到充分理解。在这项工作中,我们通过探测框架分析 CLAP 音频嵌入,研究三个基本感知维度的编码:混响 (RT60)、响度 (LUFS) 和频谱内容,通过频谱质心 (SC) 和相对音调 (RP) 进行测量。复杂性不断增加的探针经过训练,可以根据跨越噪声、语音、单音音符和音乐混合的五个数据集的冻结嵌入来预测每个属性。我们的主要发现是,所有这些属性都可以从所检查数据集的 CLAP 嵌入空间中可靠地恢复。在这个全局图像中,出现了两种编码机制:RT60、LUFS 和 RP 近似线性编码,而 SC 需要非线性探针。这两种机制都概括了八个额外的音频基础模型,但值得注意的例外是振幅不变架构完全通过构造丢弃了响度。所识别的线性特征方向在 RT60 和 LUFS 的数据集中具有几何一致性,而对于 RP 则具有高度的领域特定性。最后,我们提供了跨模态一致性的定性演示,表明声学描述符的文本嵌入与识别的 RT60 特征方向在几何上对齐。