论文

连续音频编码器中潜在维度和帧速率的联合分析

Joint Analysis of Latent Dimensionality and Frame Rate in Continuous Audio Encoders

模型评测模型行为与机制分析

摘要

连续音频编码器通过潜在宽度和帧速率沿特征和时间轴压缩音频,但它们对下游性能的联合影响仍不清楚。我们使用匹配的训练协议,通过下游适配器和探针,训练跨越四种宽度和四种帧速率的十六个编码器。尽管在较大宽度下重建普遍得到改善,但自动语音识别(ASR)和口语问答(SQA)在较高速率下更倾向于中等宽度,在更强的时间压缩下,观察到的最佳宽度会向更大的值移动。冻结模型 PCA 干预揭示了不同的重建和识别敏感性:删除后半部分组件会显着降低高速率 512 维编码器中的 ASR,且重建惩罚相对较小,而 1024 维编码器则在很大程度上保留了这两者。然而,在 12.5Hz 的 ASR 上,预计的 1024 维模型的性能低于未修改的较窄模型。这些发现确定了下游效用中的宽度-速率相互作用,并表明在训练过程中如何组织表示比重建保真度和可压缩性更重要。