论文

FireRedAudio:一种通用音频语言模型,具有用于理解和生成的解耦连续表示

FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation

模型架构混合架构

摘要

统一的音频模型必须识别和理解语言、副语言和环境信息,同时支持语音合成和编辑。一个关键的挑战是表示:理解有利于适合长上下文建模的紧凑特征,而语音生成需要保留细粒度声学细节的可重构特征。我们引入 FireRedAudio,这是一种具有共享 9B 参数 LLM 的通用音频语言模型。据我们所知,它是第一个公开披露的统一音频语言模型,为单个可训练自回归 LLM 中的理解和生成提供单独的连续输入表示。要识别或分析的音频由专用音频编码器处理,而用于生成的语音输入则使用基于 RedAE 的路径。 LLM 直接生成文本或调节流量匹配 DiT 以产生连续的声学潜伏。通过渐进式多任务训练,FireRedAudio 支持 ASR 和音频理解,后者可扩展至长达一小时的录音,以及零样本 TTS、Instruct TTS 以及语义和声学语音编辑。其长格式音频的结构化组织实现了秒级时间戳精度。在综合评估中,FireRedAudio 在音频理解和多语言 ASR 方面实现了竞争或领先的表现,在零样本 TTS 中实现了强大的内容准确性和说话人保留,在 Instruct TTS 中领先的指令跟踪,并且在语义和声学语音编辑方面比 Ming-Uni​​Audio-Edit 有了实质性改进。这些结果证明了解耦连续输入表示在中等规模模型中统一音频理解和连续潜在语音生成的可行性。我们的代码可在 https://github.com/FireRedTeam/FireRedAudio 获取。