论文
连续扩散口语模型的缩放特性
Scaling Properties of Continuous Diffusion Spoken Language Models
摘要
仅语音的口语模型 (SLM) 在性能上落后于文本和文本语音模型,最近的离散自回归 (AR) SLM 表明需要大量的计算和数据来匹配文本模型。由于 AR 的连续语音离散化会产生瓶颈,因此我们探讨连续扩散 (CD) SLM 是否更可行。为了量化 SLM 的语言质量,我们引入了音素 Jensen-Shannon 散度 (pJSD) 指标。我们的分析揭示了 CD SLM,镜像 AR 行为,展示了验证损失和 pJSD 的缩放定律,并显示最佳词元与参数比率随着计算规模而减小。然而,对于后者,损失对数据和模型大小的选择变得不敏感,显示出快速推理的潜力。将 CD SLM 扩展到 16B 参数并包含数千万小时的对话数据,可以生成情感丰富、韵律优美、多说话者、多语言的语音,尽管实现长形式的连贯性仍然是一个重大挑战。