论文

Ruby-ASR:联合正字法和词汇阅读识别的证据保存监督

Ruby-ASR: Evidence-Preserving Supervision for Joint Orthographic and Lexical-Reading Recognition

模型训练监督微调与指令调优

摘要

传统的日语自动语音识别(ASR)是由拼写记录监督的,尽管相同的书面形式可以对应于语音中实现的不同词汇阅读。此类话语接收相同的目标,因此监督界面中不存在它们的阅读区别,并且无法通过事后纯文本字素到音素的转换来可靠地恢复。我们提出了 Ruby-ASR,它将传统目标细化为跨度范围的正字法-词汇阅读序列。与单独的完整句子拼写和语音输出不同,Ruby 表示将每个书面跨度本地绑定到其实现的阅读,并允许两个视图的确定性恢复。我们使用 Qwen3-ASR 主干在字幕样式和逐字样式转录约定下实例化目标; Mora 级 CTC 目标提供辅助单调阅读监督。五个日本基准的实验结果表明,细化识别目标可以提高词汇阅读恢复,而不会牺牲可读的正字法转录。我们发布检查点和推理代码。