论文
迈向量化 ASR 模型中的基准优化
Towards Quantifying Benchmark Optimization in ASR Models
摘要
公共基准是自动语音识别 (ASR) 模型功能的重要衡量标准。然而,由于其公开的性质,模型针对这些基准进行优化的方式可能无法很好地推广到现实世界的数据。我们提出了一种量化基准优化的方法,重点关注音频不足以确定参考转录的情况。我们确定了三个行为探针系列,这些探针揭示了模型在音频不确定的情况下再现基准参考跨度的能力:参考不一致、屏蔽数恢复和正交转换。我们发现,即使相关音频相互矛盾、被掩盖或含糊不清,得分最高的开源模型也会输出逐字参考转录本。使用各种机械探针,我们表明模型对狭窄的声学线索做出响应,以覆盖音频的忠实表示,以支持基准优化策略。我们展示了基准优化的行为可以通过低秩线性转向或在某些情况下简单地将音频附加到片段的末尾来进行因果操作。总体而言,我们的结果表明,高性能模型表现出基准条件行为,这些行为可能会夸大基准性能,而不会反映出通用转录能力的提高。