论文

合成ASR训练数据中,对话停顿与重叠时序的作用

On the Role of Conversational Timing in Synthetic Training Data for ASR

模型训练合成数据

摘要

合成多说话人对话广泛用于训练对话式自动语音识别 (ASR) 系统,但仍不清楚哪些时序属性使模拟数据最有用。本文将对话时间作为一个可控的训练变量来研究,而不仅仅是作为一个要复制的语料库统计数据。我们使用从多个对话语料库估计的指数倾斜族来参数化暂停和重叠时间分布,然后使用拉丁超立方采样和多目标贝叶斯优化来探索所得的四维参数空间。每个采样的时序配置用于生成模拟训练对话、训练 ASR 系统,并评估匈牙利语对话语料库上的串联排列单词和字符错误率(cpWER 和 cpCER)。结果表明,与原始模拟器坐标或语料库邻近度相比,诱导时序统计可以更直接地解释下游 ASR 行为。特别是,较高的重叠暴露与较低的 cpWER 相关,而较长且可变的间隙与较高的 cpWER 相关; cpCER 遵循相同的趋势,但统计支持较弱。贝叶斯优化产生了适度的总体改进,但其主要价值是分析性的:它产生受控的时间干预,揭示了模拟对话训练数据中的重叠-间隙权衡。这些发现表明,现实模拟应该辅以与任务相关的重叠、间隙和时序变异性诊断。