论文

Stride-k 子采样:Whisper 的免训练音频词元减少

Stride-k Subsampling: Train-Free Audio Token Reduction for Whisper

模型推理推理加速

摘要

Whisper 通过固定的 1500 个词元编码器接口公开语音,该接口现在是 ASR 解码器和基于 Whisper 的语音语言模型 (SpeechLM) 的默认表示形式,但其冗余在很大程度上仍未得到检验。我们提出了 stride-k 子采样,这是一种确定性索引操作,它保留卷积词干或编码器 Transformer 之后的每个第 k 个标记。在五个 Whisper 音阶中,k=2 保留了两个位置的基线 WER,CKA 将这种稳定性归因于茎处的声学重叠以及编码器输出处注意力引起的重新分配。在这两个位置应用 stride-2 可将音频词元减少 75%,将总 GFLOP 减少 52-58%,在大多数 ASR 基准上 WER 成本较小,而在较难的基准上则成本较高。相同的配置扩展到三个基于 Whisper 的 SpeechLM,在较强的基线上产生适度的准确度下降,在较弱的基线上产生较大的下降,同时将端到端延迟减少 19.6-27.4%。 stride-k 子采样不需要训练或辅助计算,利用 Whisper 的预处理冗余,表明其音频词元接口承载的容量比下游任务所需的容量更大。