论文

StepAudio 第三代技术报告

StepAudio 3 Gen Technical Report

模型架构新型架构

摘要

我们推出了 StepAudio 3 Gen,这是一种通用音频生成模型,支持统一框架内的零样本文本转语音 (TTS)、语音设计、声音生成、音效、音乐、氛围语音以及多种音频类型的混合。 StepAudio 3 Gen 的核心是一个离散自回归生成器,它直接通过残差矢量量化 (RVQ) 词元对音频进行建模,这与最近通用音频模型中流行的基于扩散 Transformer 的连续生成范例不同。其 StepAudio Tokenizer 在共享的 16 美元×2048 美元剩余代码空间中表示 12.5 Hz 的一般音频,联合量化语义和波形级声学特征,以便每个代码层保留两种类型的信息。对于生成,主干网络使用自回归建模沿时间轴预测第一个码本,而轻量级因果 Transformer 沿码本轴完成剩余的十五个码本。我们的研究进一步确定了三个关键设计原则:(1) 干扰感知渐进式预训练,用于获取音频功能,同时保留大语言模型的文本能力;(2) RVQ 适配器,用于有效合并多码书声学表示;(3) 在通用音频域的共享表示上进行离散自回归建模。通过渐进式预训练、多任务指令训练和监督微调,StepAudio 3 Gen 在 TTS 和语音设计方面实现了最先进的性能,同时保留了跨语音、人声、音效和音乐的强大生成能力。音频样本可在 https://stepaudiollm.github.io/step-audio-3-gen/ 获取。