技术实践

淘天数字人以Qwen Omni流式链路降低对话延迟

应用与实践模型推理推理加速语音识别与转写语音交互与综合语音服务

概述

基线链路为「ASR → LLM → TTS & A2BS」三段串行,ASR 结束才能发起文本请求、需等到标点截断才调用 TTS 与面部动画生成,实测(人设提示词 2 万字以上、每组 10 个会话)端到端延迟平均 5.64s 且稳定性不佳,其中 ASR 平均 2.28s、LLM 首 Token 平均 2.26s、TTS 平均 2.03s。 团队评估过多条路线(换 Audio2Audio 一体模型会丢字幕、对比 Qwen-Max/Omni/Plus 的 TTFT、TTS 1s chunk 与端上缓存、服务同机部署降调用成本等),因字幕需求最终采用 Qwen Omni 的 Text→Audio/Text 模式:ASR 后的文本送 Omni,LLM 直接流式返回音频与文字,端上补建嘴型并同步播放,新链路为「ASR→LLM(Text/Audio)→A2BS」。 配置侧在 JSON 中新增 character_bs 与 Omni_audio.enabled 开关(model_name 为 qwen3-omni-flash、voice 为 Cherry)。由于 Omni 每个 chunk 约 20480 字节、逐 chunk 请求 A2BS 会让表情不连续,端上按采样率累积 1~2 秒音频窗口(OmniA2BSConfig:targetDurationSeconds 1.0、sampleRate 24000)再触发 A2BS 并做平滑。 最终平均端到端延迟从 5644ms 降至 1323ms,提升 76.6%,P95/P99 亦控制在合理范围。后记指出 Omni 仅支持官方音色,自定义音色场景拟改用任意 LLM + 百炼 2025 年 11 月发布的 Qwen-TTS-Realtime 复刻音色并经 WebSocket 流式对接。