论文
Raon-演讲技术报告
Raon-Speech Technical Report
摘要
我们推出了 Raon-Speech,这是一种用于英语和韩语语音理解、应答和生成的顶级 9B 参数语音语言模型 (SpeechLM),以及 Raon-SpeechChat,这是一种用于自然实时对话的高性能全双工扩展。 Raon-Speech 成功地将预训练的 LLM 转换为 SpeechLM,它既可以理解并生成语音,同时又保留强大的文本功能。它在 138 万小时精心策划的英语和韩语语音和文本数据集上进行训练,具有以下训练阶段:(1) 语音模块对齐,(2) 具有 知识蒸馏 的端到端 SpeechLM 预训练,以及 (3) 基于多任务偏好优化的 后训练。在 42 个英语和韩语语音和文本基准测试中,Raon-Speech 与包括 Qwen2.5-Omni 和 Fun-Audio-Chat 在内的八个类似大小的最新音频基础模型进行比较,在以语音为中心的任务上建立了最强的整体概况,同时保留了强大的文本问答性能。在此基础上,Raon-SpeechChat 通过对 119K 小时时间对齐的真实和合成对话数据进行持续训练,实现自然的全双工对话。它经历三个互补的训练阶段:(1) 因果编码器适应,(2) 全双工 预训练,(3) 用于语音和角色控制的全双工 微调。在多个全双工基准测试中,Raon-SpeechChat 在 FDB v1.0 涵盖的轮流和中断敏感行为方面显示出最明显的优势,并且在更广泛的全双工评估套件中保持竞争力。我们开源所有模型检查点、训练和推理管道以及交互式演示。