论文
自监督语音模型学习表示中的维度感知异常检测
Dimensionality-Aware Anomaly Detection in Learned Representations of Self-Supervised Speech Models
摘要
自监督语音模型(S3M)实现了强大的下游性能,但在自然和对抗性扰动下,它们的学习表征仍然知之甚少。先前的研究依赖于表示相似性或全局维度,对局部几何变化的可见性有限。我们问:扰动如何使局部几何形状变形,这些变化是否跟踪下游自动语音识别(ASR)退化?为了解决这个问题,我们提出了 GRIDS,这是一个在 WavLM 和 wav2vec 2.0 中跨层表示使用局部固有维数 (LID) 的框架。我们发现,LID 在所有低信噪比 (SNR) 扰动下都会增加,在高 SNR 下会发散:良性噪声向干净的轮廓收敛,而对抗性输入则保留早期层的 LID 提升。我们发现 LID 升高与 WER 增加同时发生,并且分层 LID 特征可以实现异常检测 (AUROC 0.78-1.00),为 S3M 中的无转录监测打开了大门。