论文

TTS-STT 飞轮:合成实体密集音频缩小了商业和开源系统失败的印度 ASR 差距

The TTS-STT Flywheel: Synthetic Entity-Dense Audio Closes the Indic ASR Gap Where Commercial and Open-Source Systems Fail

模型训练合成数据

摘要

利基域印度语 ASR——数字字符串、货币金额、地址、品牌名称、英语/印度语代码混合——开源 SOTA 和商业系统都没有提供足够的服务。在综合实体密集泰卢固语测试集(由综合系统提供)上,vasista22/whisper-telugu-large-v2(开放 SOTA)实现了实体命中率(EHR)0.027 和 Deepgram Nova-3(商业)0.16。我们通过独立的 TTS<->STT 飞轮来缩小这一差距:开源印度语 TTS 管道以 <50 美元的边际成本合成了约 22,000 个实体密集的印度语-英语代码混合话语,并且基于 vasista22 的 LoRA 微调在保留测试中实现了 EHR 0.473(是开放式 SOTA 的 17 倍,是商业版的 3 倍),并具有散文阅读回归FLEURS-Te 上的 WER 为 +6.6 pp。跨语言:beta-Hi 0.337(7x 与 vasista22)和 beta-Ta 0.543(22x 与 vasista22、22x 与 Deepgram);在 Deepgram 拥有大量实体覆盖的印地语中,飞轮的表现低于商业。所有三个测试版模型均低于预先注册的 EHR 目标(Te 为 0.75,Hi/Ta 为 0.65);我们诚实地报告。人类本地记录的健全性检查(n = 20 泰卢固语)确认转换为真实语音(本地 beta-Te EHR 0.516,合成器 0.473)。 EDSA 隔离消融(仅在 FLEURS-Te 上使用 LoRA)在相同的保留条件下产生 EHR 0.020,将约 100% 的增益归因于 EDSA 语料库。我们还报告了一项语言条件发现:vanilla Whisper-large-v3 具有泰卢固语特定的脚本崩溃(SFR 0.46-0.71),每种语言的 LoRA 都会纠正(SFR 0.81-0.97),但该配方在印地语和泰米尔语中是禁忌的,其中 vanilla SFR >= 0.98。代码、保留、预测、EDSA 语料库和实体词典均开源发布。