论文
SpeakPay:Whisper 的域自适应 LoRA 微调,用于低资源尼泊尔金融语音识别
SpeakPay: Domain-Adaptive LoRA Fine-Tuning of Whisper for Low-Resource Nepali Financial Speech Recognition
摘要
尼泊尔的移动支付应用程序采用图形方式,视力障碍用户基本上无法使用。本文介绍了 SpeakPay,一种语音优先的数字钱包,并记录了核心技术贡献:针对低资源金融语音识别的领域适应的受控研究。我们引入了 NepFinSpeech-403,这是一个尼泊尔金融语音命令的 403 个话语数据集(跨越 237 个唯一数字的发送、加载和平衡操作),并使用 LoRA 微调 Whisper large-v2。在保留的测试集上,领域适应模型将单词错误率从 129.95%(零样本基线)降低到 42.58%,相对降低了 67.2%,并将梵文数字识别准确率从 0.0% 提高到 73.9%。我们发现字级指标低估了实际任务级影响:领域适应将交易成功率从 1.67% 提高到 33.33%,大约提高了 20 倍。这种改进在个人话语级别(符号测试,$p < 10^{-17}$)和所有命令类型上都是一致的。数据效率分析表明,只需 100 个特定领域的话语就足以将零样本 WER 减半,而性能在 300 个示例左右趋于稳定。错误分析揭示了系统性数字混淆模式(零插入/删除、前缀幻觉),这些模式是剩余交易失败的大部分原因。经过训练的系统被部署为可公开访问的语音优先 Web 应用程序。所有代码、数据集、模型权重和本文均在 https://github.com/subedibiraj/speakpay 发布。