论文

StreamTN:对话系统中流式 TTS 的低延迟流式中文文本规范化模型

StreamTN: A Low-Latency Streaming Chinese Text Normalization Model for Streaming TTS in Dialogue Systems

模型推理批处理与并行

摘要

文本转语音 (TTS) 是在以大语言模型 (LLM) 为中心的口语对话系统 (SDS) 中提供语音响应的重要模块。为了确保准确的 TTS 合成,LLM 生成的响应必须通过文本标准化 (TN) 模块转换为 TTS 可读格式,这在实时 SDS 场景中提出了严格的低延迟要求。现有的 TN 解决方案很大程度上是基于规则的,依赖于手动工程,并且对于看不见的模式的泛化能力很差。尽管 LLM 本身可以通过即时工程执行 TN,但它面临着关键的限制:由于非流处理、幻觉风险以及仅针对 TN 微调核心 LLM 模块时智力或推理能力下降而导致的高首词元延迟。为了应对这些挑战,我们提出了 StreamTN,一种基于 LLM 的轻量级中文流媒体 TN 模型。 StreamTN 基于 Qwen3-0.6B 构建,采用双轨流框架,其中输入词元和输出词元在两个并行轨道上处理,无需复杂的提示即可实现低延迟实时推理。此外,与基于规则的系统和通用大语言模型相比,针对特定任务的微调可产生卓越的 TN 性能并减少幻觉。我们还引入了跨越多种文本场景的 TN 基准,为口语对话系统中的语音生成提供了全面的评估标准。实验证明了 StreamTN 在准确性和推理延迟方面的有效性。