论文

FormalASR:端到端汉语口语到正式文本

FormalASR: End-to-End Spoken Chinese to Formal Text

应用与实践语音识别与转写

摘要

自动语音识别 (ASR) 系统通常针对逐字转录进行优化,从而保留通常不适合下游面向写作的应用程序的不流畅、填充词和非正式口语结构。常见的解决方法是用于后期编辑的两级 ASR+LLM 管道,但这种设计会增加延迟和内存成本,并且难以在设备上部署。我们提出了 FormalASR,这是两个紧凑的端到端模型(0.6B 和 1.7B),可以直接将中文口语转录成正式的书面文本。为了启用此设置,我们构建了 WenetSpeech-Formal 和 Speechio-Formal,这是两个由基于 LLM 的重写和质量过滤构建的大型口语到正式数据集。然后,我们使用监督 微调 在两个尺度(0.6B 和 1.7B)上微调 Qwen3-ASR。 WenetSpeech-Formal 和 Speechio-Formal 上的实验表明,与逐字基线相比,FormalASR 的相对 CER 降低了高达 37.4%,同时还改进了 ROUGE-L 和 BERTScore。 FormalASR 在部署时无需进行后处理 LLM,为口语到正式转录提供轻量级设备上解决方案。