论文
具有可学习的每通道能量标准化的时间包络前端,用于基于耳语的儿童 ASR
A Temporal-Envelope Frontend with Learnable Per-Channel Energy Normalization for Whisper-Based Children's ASR
摘要
时间包络携带对语音清晰度至关重要的线索,但基于 log-mel 频谱图的 ASR 前端并未明确模拟连续子带包络结构。这种限制对于儿童语音来说尤其严重,因为儿童语音的高声学变异性需要强大的特征表示。我们提出了一种模块化时域前端,它使用梅尔间隔窗口正弦滤波器和希尔伯特变换将语音分解为子带包络,并具有与 Whisper 模型联合优化的可学习每通道能量归一化 (PCEN)。在 MyST 儿童语音语料库上,系统消融将全频带加窗 sinc 滤波器、希尔伯特包络、25 Hz 平滑截止和可学习的 PCEN 识别为最佳配置。在相同的 Whisper-small 微调设置下,前端将 WER 从 13.16% 降低到 11.08%,比 log-mel 基线相对降低了 15.8%,并且在相同的清理测试分割上优于评估的 Kid-Whisper 检查点。这些结果表明,时间包络表示和可学习的前端标准化是对儿童 ASR 后端适应的有效补充。