论文

基于Whisper的印地语带时间戳转写

Timestamped Hindi speech transcription using Whisper

应用与实践模型训练监督微调与指令调优语音识别与转写

摘要

时间精确的语音转录在关键应用中至关重要,例如医学对话转录、阅读评估和非典型语音识别。编码器-解码器自动语音识别模型(例如 Whisper)不会为所有语言生成开箱即用的单词级时间戳。现有的单词级时间戳估计方法要么使用能够进行帧级音素/字符预测的外部 CTC 模型,但计算成本较高,或者使用模型内部的交叉注意分数来提供粗略的时间戳。在本文中,我们考虑印地语的带时间戳的语音转录。我们提出了一种基于 CTC 的方法,其中我们直接在 Whisper 编码器输出上训练低复杂性字符级 CTC 头,以解决现有工作的复杂性和粒度限制。我们使用手动注释的字级时间戳来评估系统。实验表明,所提出的基于内部 CTC 的方法与使用外部 CTC 模型的性能相似,并且优于基于交叉注意力评分的方法。此外,我们研究了使用 CTC-head 输出来检测和减轻会话语音中的幻觉。我们的结果表明,从 CTC 输出导出的简单标记长度标准可以提高更可能出现幻觉的短片段的转录质量。