论文

用于紧凑日语语音模型参数高效适应的高价值综合监督

High-Value Synthetic Supervision for Parameter-Efficient Adaptation of a Compact Japanese Speech Model

模型训练参数高效训练

摘要

私域语音难以收集和重新分发,而紧凑模型需要针对特定任务的监督。我们研究了一种可审计的综合管道,将日本的护理交接直接映射到六字段结构化注释。使用 182 个合成训练和开发剪辑,我们通过全面微调和 16 级 LoRA 来调整 1.47B 音频模型。在 39 片段场景种子不相交综合测试中,未适应的模型获得的模型判断事实回忆分数为 0.0500,完全调整为 0.8664,LoRA 为 0.8461。 LoRA 的描述性比例达到了全调优总量的 97.7%,而项目遥测报告了 1240 万个可训练参数,约占主干网的 0.85%。两种适应都在同一基础上显示出巨大的成对增益;完整与 LoRA 的间隔过零,并且不同的优化设置排除了等效性声明。这是参数高效的能力获取结果,而不是设备性能结果:未测量延迟、内存、能量和实时因素。所有评价言论和目标都是综合的,参考文献是模型提出的,评判者是未经校准的。证据表明,紧凑的模型可以从数百个与出处相关的合成示例中获得狭窄的音频到结构的转换;它没有建立临床有效性、真实语音传输或相对于干净云系统的优越性。