论文

瑞士德语 ASR 的 Whisper 的字幕对齐 微调:基准污染、约定不匹配以及 25.6% WER (13.8% cWER) 的诚实基准

Subtitle-Aligned Fine-Tuning of Whisper for Swiss German ASR: Benchmark Contamination, Convention Mismatch, and an Honest Baseline at 25.6% WER (13.8% cWER)

模型训练监督微调与指令调优

摘要

我们对 微调 OpenAI 的 Whisper large-v3 瑞士德语 ASR 进行了系统研究,使用 1,367 小时的广播语音搭配标准德语字幕作为弱监督。通过在 NVIDIA DGX Spark(Grace Blackwell,128 GB 统一内存,高达 1 PFLOP FP4)上运行 16 次迭代训练,我们比较了 LoRA 和 1.55B 参数模型的完整 微调,调查幻觉根本原因,并量化数据质量、字幕对齐和训练策略的影响。我们的最佳模型在对严格不相交的数据进行诚实评估时,在所有瑞士德语方言测试集 (ASGDTS) 上取得了 25.6% 的测量 WER。将真正的错误与有效的文体变化(时态、词序、瑞士拼写法)分开的统一错误分析得出的内容 WER (cWER) 为 13.8%(仅计算实际识别失败)。经过偏差校正的估计将其降低至 8.5%,这表明真实错误率大约是测量的 WER 的三分之一。我们证明,已发布的最先进的瑞士德国 ASR 结果(17.1-17.5% WER)因基准污染而被夸大:在 ASGDTS 测试集上使用零瑞士德国数据进行自我训练的普通 Whisper 模型达到了 13.88% WER,超过了所有已发布的系统。 Phi-4-multimodal 的实验显示出更强的记忆效果(3.9% WER),表明该基准主要衡量惯例匹配而不是方言理解。我们发布了两个模型,一个 LoRA 适配器(25.32% WER,13.9% cWER)和一个完全微调的模型(25.60% WER,13.8% cWER),这是少数几个公开可用的、诚实评估的瑞士德语 Whisper 模型,在 Apache 2.0 下具有完全可重复性,不需要机构数据协议。