论文

数据规模(而非延迟)决定了流式 ASR 中的跨语言编码器传输

Data Scale, Not Latency, Shapes Cross-Lingual Encoder Transfer in Streaming ASR

模型评测模型能力评测

摘要

使流式语音识别模型适应新语言需要在两种可能的热启动之间进行选择:多语言 (ML) 编码器或纯英语 (EN) 编码器。普遍的直觉是,多语言编码器应该在低数据量情况下提供最大帮助,但尚不清楚这种优势能持续多久,严格的流延迟是否会放大它,以及它是否能经受住部署量化。我们通过 0.6 B 参数缓存感知型 FastConformer 传感器的受控扫描来回答这些问题,涵盖八种欧洲语言、最多五个目标语言数据范围(100 小时到 2500 小时)、三个流层加离线解码以及最多四个公共测试集。主要结果是多语言初始化是一种数据有限的优势,而不是延迟限制的优势。在 160 毫秒的 FLEURS 上,平均 EN-ML 单词错误率 (WER) 差距从 100 小时的 +4.21 个百分点 (pp) 下降到 2500 小时的 +0.20 个百分点;幂律拟合总结了这种衰减,目标语言数据每增加一倍,剩余优势就会大致减半。在三个流层中,跨语言平均 EN-ML 差距在 100 到 1000 小时的每个尺度上大致稳定,到 2500 小时接近于零。最后,在匹配的 560 ms 流层上进行 4 位仅权重编码器量化可将编码器占用空间减少约 3 倍,平均 FLEURS WER 增加约 0.5 pp。由此产生的指导方针很简单:在低数据状态下使用多语言初始化,将选择视为与大数据实际上无关,并独立做出延迟和量化决策。