论文

聆听、思考、转录:ASR 的连续潜在测试时间缩放

Listen, Think, Transcribe: Continuous Latent Test-Time Scaling for ASR

模型推理测试时计算扩展

摘要

端到端 ASR 模型一次性转录,不给解码器留下重新访问硬输入的空间。我们提出 LatentASR,这是一种参数高效的方法,它将连续的潜在测试时间缩放添加到冻结的 ASR 主干中。两个小的可训练模块驱动它:一个潜在适配器,通过有界、稳定的更新迭代地细化一些潜在前缀位置;以及一个值头,预测额外的计算是否会有所帮助并提前停止循环。 Qwen3-ASR-0.6B 主干网保持完全冻结,我们仅训练约 4M 的额外参数。我们用一个特意小的、多样化的 500 句话训练集来激活这个循环。在这种最小数据体制下,标准的适应方法都会退化:完整的 微调、LoRA 和提示调整都会增加 WER。 LatentASR 是唯一经过测试的方法,可以在两个干净基准测试上降低 WER(相对 FLEURS -2.54% 和 VoxPopuli -0.47%)。削减主要集中在本质上的硬投入上。在重音和代码转换语音 (ASCEND) 上,LatentASR 实现了 16.0% 的相对 CER 降低。在 30 种 FLEURS 语言(23,049 个话语)中,多语言 WER 在各个资源层中均匀下降,证实了适配器可以泛化而不会过度拟合。动态停止以一小部分计算保留了大部分清理集减少,跳过了入口处所有话语的大约一半。我们的结果表明,精心选择的小型激活集可以在冻结的 ASR 模型内打开测试时间缩放,而不会破坏模型本身,从而将固定的每句话计算转换为最需要的依赖于输入的计算。