论文
以非对称无分类器引导校准目标说话人语音识别
Asymmetric Classifier-Free Guidance for Target-Speaker ASR
摘要
目标说话人自动语音识别 (TS-ASR) 必须在不同的重叠和噪声条件下识别和转录所需的说话人。这些变化改变了语音混合物中目标说话人的声学证据,激发了说话人调节的推理时间校准。我们使用 Whisper 为 TS-ASR 引入非对称无分类器指导(CFG):说话人条件分支预测目标转录本,而说话人非条件分支预测序列化的多说话人转录本。 CFG 通过单一指导尺度调整解码过程中说话人调节的贡献。我们在目标域开发数据上选择一个全局指导尺度,并训练一个基于编码器的轻量级预测器来针对每个话语进行调整,从而保持识别模型固定。在域转换下,我们的整个系统与仅条件基线相比,相对词错误率 (WER) 降低了 21.8%,与相同 CFG 训练模型的标准条件解码相比,相对词错误率 (WER) 降低了 5.6%。 Oracle 分析表明,通过话语级别的规模选择可以大幅降低 WER,并确定有益的调整如何随域转移而变化。
