论文

标签中的权衡:轮流感知流 ASR 的因果监督

The Trade-off Was in the Labels: Causal Supervision for Turn-Aware Streaming ASR

模型训练监督微调与指令调优

摘要

语音代理必须时刻决定用户是否已经完成;沉默很少能解决问题:读取电话号码的呼叫者会在数字中间停顿,只用一个字“停!”当一个回合结束时,一个长问题所带来的停顿时间比真正的回合间隙还要长。语音活动检测器加上静音超时(部署的默认值)无法将它们分开,因为轮内暂停通常会超过轮间间隙;它们的区别在于到目前为止的单词是否形成一个完整的思想:识别器计算什么来生成转录本。我们提出了第一个针对回合感知流式 ASR 的开放式训练方法和基准:Qwen3-ASR-0.6B 上的小型 LoRA 适配器,在一个 GPU 上经过数小时的训练,可进行转录、从含义和静音中检测回合结束、处理听写以及在上下文中进行转录。在部署匹配的基准测试中,它在中值延迟为 0.39 秒时达到 0.97 边界召回率,每语音分钟出现 0.3 次错误触发,并在新的测试集上进行复制;没有静默超时达到这一点。该配方基于一个原则:每个流决策标签必须从输入到决策点都是可计算的。离线语料库违反了它,编码了未来;当附加一秒的沉默将“损坏”模型的回合结束召回率从 0.10 提高到 1.00 时,这种具有洞察力的标签制造了振荡和幻影召回率与精度的权衡。同样的泄漏在上下文中再次出现:始终匹配的偏向前缀成为复制的快捷方式(40% 入侵),而与音频不一致的反事实将其削减至 0.8%,同时保留了 +28.9 pp 实体召回优势的大部分。