论文
用于设备上文本转语音的 RVQ 位置感知推测解码
RVQ Position Aware Speculative Decoding for On Device Text to Speech
摘要
使用 Transformer 模型的自回归解码 (AR) 受单流推理的内存带宽限制,这是设备上文本转语音 (TTS) 的典型部署机制。使用 Qwen3-TTS 进行实时流传输每秒需要超过 200 个顺序模型调用,主要由内部循环 MultiCodeDecoder 控制,该内部循环每 80 毫秒音频帧发出 15 个残差矢量量化 (RVQ) 代码。我们为 MultiCodeDecoder 提出了 RVQ 位置感知推测解码,以 5\times10^{-4}$% 的添加参数和每轮推测/验证开销 10% 到 20% 的方式,每个模型调用获得 2.47 个接受的词元,将实时合成从每秒 200 次顺序模型调用减少到 88 次。该方案在部署的top-k采样下是分布无损的,并且与原系统的WER奇偶校验与这一保证是一致的。我们在最新的 iPhone 和 Apple Silicon Mac 设备上使用 Qwen3-TTS 0.6B 将 RVQ 词元生成速度提高了 2 至 2.2 倍。