论文

从多语言流 ASR 主干网到肯尼亚语言系统:Nemotron 3.5 针对 Kikuyu、Dholuo 和 Kalenjin 的以数据为中心的调整

From a Multilingual Streaming ASR Backbone to Kenyan-Language Systems: Data-Centric Adaptation of Nemotron 3.5 for Kikuyu, Dholuo, and Kalenjin

模型训练监督微调与指令调优

摘要

非洲语言的自动语音识别 (ASR) 受到拼写不一致、注释伪影、音频缺失、说话者和域不平衡以及与部署不同的评估程序的限制。我们提出了一项将 NVIDIA Nemotron 3.5 ASR Streaming 0.6B 应用于 Kikuyu、Dholuo 和 Kalenjin 的端到端工程研究。从肯尼亚斯瓦希里语适应的检查点开始,我们在全参数 微调 期间保留其缓存感知的 FastConformer RNN-T、提示调节和流解码器。该研究涵盖语料库审计、Unicode 标准化、分割检查、持续时间过滤、低速率延续、基于验证的检查点选择、真实流评估、工件保存和隔离服务。在排除上下文梯度更新的内部自适应咨询评估集上[56,13],选定的 Kikuyu 和 Dholuo 模型分别实现了 42.97% 和 33.98% 的 WER。 Dholuo 在其冻结历史标签政策下记录了 9.59% 的 CER 和 8.13% 的无空间 CER;基库尤记录了 7.79% 的无空间 CER。 Kalenjin 仍在进行中:v1-v 在 2,411 行 clean-v3 诊断子集上达到 68.74% WER,不包括长暂停注释、数字引用和短于三个标记的目标。它的检查点选择使用包含测试源行的混合源验证清单,因此分数不是独立的泛化估计。我们还报告了涉及非语音标签、短话语过度生成、边界敏感 WER 和云作业生命周期故障的负面调查结果。我们没有提出最先进的主张,因为内部设置、反复协商和标准化与公共基准不同。这项工作提供了一种可审计的方法,可以将多语言流模型适应特定于语言的系统,而无需放弃流约束。