论文
ROMPAR:罗马尼亚语口音语音识别的形态补全和人口统计遗忘
ROMPAR: Morphological Completion and Demographic Unlearning for Romanian-Accented Speech Recognition
摘要
由于人口统计偏差、方言变化以及分割过程中的话语截断等技术问题,议会会议记录的自动转录面临着重大障碍。本文介绍了 ROManian PARliamentary Speech Corpus (ROMPAR) 数据集,这是一个 17.80 小时的罗马尼亚语和摩尔达维亚议会演讲语料库,具有双注释 真值 和重构单词片段的显式标签。为了构建强大的 ASR 系统,我们提出了一个多任务对抗性训练框架,该框架可以强制跨年龄、性别和方言的人口统计不变性。我们通过引入对抗系数的指数衰减机制来解决生成架构中对抗目标固有的不稳定性。此外,我们实现了具有位置相关加权的 LLM 引导解码策略,以促进截断终端词的形态完成。我们的结果表明,所提出的框架显着降低了 WER,并在形态重建中实现了 96.6% 的 F1 分数。