论文
经过韵律训练的表示是否有助于超越可训练的融合?使用冻结 HuBERT 进行参数匹配研究
Does a prosody-trained representation help beyond trainable fusion? A parameter-matched study with frozen HuBERT
摘要
明确的韵律线索可能有助于自发语音的自动语音识别(ASR),但辅助表示通常需要额外的可训练组件,这使得我们不清楚增益是来自辅助信息还是融合机制。我们使用冻结的 HuBERT 主干和经过训练来预测 log F0、发声、Delta log F0、对数能量和频谱倾斜的 64 维表示来解决这个问题。我们比较了冻结主干识别器(Baseline)、具有零辅助输入(Null)的可训练融合,以及提供学习表示(Learned)的相同融合。在 Buckeye、Switchboard 和 AMI IHM 中,Null 使 WER 比基线降低了 0.71-1.45 分,而 Learned 与 Null 相差 +0.07、-0.09 和 +0.00 分,没有显着差异。然而,在推理时删除或不匹配表示会增加学习的 WER。因此,Learned 取决于表示,但与参数匹配控制相比,没有显示出可测量的增量 WER 优势。