论文

双语 NVV 感知 ASR 的源自适应数据管理

Source-Adaptive Data Curation for Bilingual NVV-Aware ASR

模型训练合成数据

摘要

非语言发声 (NVV),例如笑声、叹息、呼吸和咳嗽,传达了传统自动语音识别 (ASR) 系统经常丢弃的情感和交互信息。我们在 ISCSLP 2026 上为 NVVSpeech 挑战赛的第一轨提出了一个双语普通话-英语系统,该系统需要在转录相对位置联合转录词汇内容和 16 个 NVV 类别。我们的 NVV-Aware Whisper 通过检查点兼容的词汇重新映射来适应 Whisper-medium,从而能够在统一的自回归序列中对词汇标记和内联 NVV 标签进行解码,而无需扩展词汇。为了提供可靠和多样化的监督,我们进一步引入了一种源自适应数据管理策略,该策略通过声学增强和多模态 LLM 过滤来完善公共 NVV 语料库,同时通过自动预处理和注释从野外媒体中挖掘自发 NVV。根据官方双语评估协议,提议的系统将最终得分从 33.32 提高到 53.61,并通过消融确认了提议的数据管理组件的互补优势。