论文
严重声学偏移下的原型修正迭代自监督流形去噪
Prototype-Rectified Iterative Self-supervised Manifold Denoising under Severe Acoustic Shift
摘要
音频文本基础模型(ATM)在严重的声学噪声下会发生灾难性的失败,而现有的适应策略要么依赖于基于梯度的测试时间适应(TTA),它会增强噪声而不是信号,要么依赖于即时调整,需要在推理时无法获得特权噪声注释。我们使用 PRISM(原型整流迭代自监督流形去噪)来解决这些故障,PRISM 是一种基于仿射噪声假设的 无需训练 无源 TTA 框架:严重的声学噪声会在多模态潜在空间中引起低秩仿射偏移,超过 90% 的失真能量仅限于前 60 个主成分。 PRISM 使用冻结文本原型作为几何锚点,通过仿射偏差回归编译成单个静态投影矩阵的三个封闭式几何校正,估计并逆转未标记目标批次的这种失真。在推理时,自适应在 0.0009 毫秒内减少到一次矩阵向量乘法,使其比基于梯度的 TTA 快得多,同时不需要额外的训练。在 UrbanSound8K 上,PRISM 比零样本基线提高了 12.94 个百分点,并且比 Oracle 辅助的 TTA 基线提高了 9.41 个百分点,尽管从未观察到其特权增强噪声提示。我们进一步确定了复调陷阱(Polyphonic Trap),这是宽带类别子空间紧缩的一种原则性故障模式,并通过置信感知回归(CAR)解决它,为受影响最严重的类别恢复了高达 8.16 个百分点。