论文

StepAudio 2.5 技术报告

StepAudio 2.5 Technical Report

模型训练强化学习

摘要

统一音频语言建模已成为现代语音系统的一个突出趋势,有望将 大语言模型 的推理能力带入听觉任务中。然而,现有的统一基础通常很难在自动语音识别 (ASR)、文本转语音合成 (TTS) 和实时语音交互方面与专业系统的深度相匹配。弥合这一差距仍然是一个开放的挑战。本报告介绍了 StepAudio 2.5,这是一个统一的音频语言基础模型,在所有三种功能上都匹配或超过了专用系统。我们没有将这些任务视为架构上不同的任务,而是在这样的前提下进行操作:一旦文本和音频共享多模式表示空间,任务专业化就变成了操作机制的问题:数据构造、优化目标和解码约束。在这一见解的指导下,我们将 后训练 范式从标准监督学习推进到根据任务定制的人类反馈强化学习 (RLHF),并将其用作定义复杂优化目标的主要机制。我们利用这种以 RLHF 为中心的对齐方式以及专门的解码,将共享骨干形成三种不同的操作模式。具体来说,ASR 分支通过可验证的多词元解码来提高转录效率; TTS 分支通过基于偏好的 RLHF 和上下文丰富的监督实现可控的、富有表现力的合成;实时分支通过 RLHF 框架内的生成奖励建模实现低延迟、角色一致的对话。在标准基准测试中,StepAudio 2.5 在 ASR、TTS 和实时方面取得了最先进的结果,表明单一的音频语言基础可以成功地将语音理解、生成和实时交互的不同部署目标内化。