论文

冻结Whisper:用辅助词重音任务改进句重音检测

A Novel Sentence Stress Detection Framework Leveraging Auxiliary Word-Stress Modeling and Loss Optimization

模型训练参数高效训练

摘要

韵律重音是自动发音评估(APA)的一个重要方面,包括句子重音检测(SSD)和词重音检测(WSD)。 SSD 突出显示语义上塑造话语意义的显着单词,而 WSD 则识别每个单词中的主要重读音节以确保词汇清晰度。然而,大多数先前的工作将 SSD 和 WSD 视为独立的任务,忽视了它们对韵律线索(例如音调、持续时间和强度)的共同依赖。为了解决这一差距,我们提出了一种有效的 SSD 方法,通过新颖的建模范例将 SSD 与辅助 WSD 相结合。此外,我们引入了一个词跨度重音正则器(WSR),它将 token 级 SSD 概率集中在每个重读词跨度内。 TinyStress-15K 基准测试的实验表明,所提出的方法优于强基线,完整配置实现了最佳 SSD 结果。

冻结Whisper:用辅助词重音任务改进句重音检测:论文原图
图 2:所提出框架的总体架构。冻结的 Whisper 骨干模型 为两个磁头提供编码器表示,并为 SSD 磁头提供解码器表示。句子重音检测 (SSD) 在 token 级别运行,并带有额外的词跨重音正则器 (WSR),而词重音检测 (WSD) 在音素级别运行。 SSD 和 WSD 头是特定于任务的,不会直接交换隐藏状态或预测。