论文

同时训练发声与静音样本,减少Whisper转录幻觉

How to Reduce Whisper Hallucination

模型训练监督微调与指令调优合成数据

摘要

Whisper 仍然是在生产中运行的:一个许可的检查点、99 种语言、无需针对每种语言进行调整。但它写的句子没人说过。在 42 个纯房间音的片段中,whisper-large-v3 在其中 61.9% 上发出文字,在 100% 上发出一些东西。通常的反应是从 Whisper 伪标签中提取学生,首先从语料库中过滤掉幻觉,这会删除证据,同时保留行为:学生适合老师正确的子集,并继承其自己的训练数据中缺少的失败模式。第二个响应,添加非语音音频,以便模型学会保持安静,已经发布并运行,但不加区别地教授抑制。这里每个非语音手臂上最好的检查点也是恢复最少的真实说出的短语并删除 58% 的重复语音的检查点。老师必须固定,有信号的两半。我们的基准测试同时对这两项进行评分:8 个手臂上的 11,852 个剪辑、6,267 个合成正片、8,296 个导致生产模型失败的真实音频剪辑,以及 58 种语言的 FLEURS。我们收集了 100 种语言的 40,891 个幻觉短语,通过测量选择文本转语音系统,并将这些短语合成为正值,因此模型满足相同的文本,既可以作为抑制的内容,也可以作为转录的内容。在 33 对匹配的微调中,仅在那些积极的方面有所不同,添加它们可以降低 31 对中真实无语音音频的单词发射,并提高 32 对中的短语恢复;在保持英语准确性的 30 对中,只有 30 对中的 30 对。最好的检查点是将沉默中的幻觉从 61.9% 提高到 2.4%,将真实无声音频中的单词从 99.9% 提高到 47.8%,同时将短语恢复率从 69.8% 提高到 82.7%。基准、词典和合成语料库发布于https://huggingface.co/datasets/Scicom-intl/Whisper-Hallucination