论文
在语音转语音生成中保留语音转文本 LLM 功能
Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation
摘要
强大的语音到文本 (S2T) LLM 已经提供了强大的语音感知和文本推理,但添加语音到语音 (S2S) 输出具有挑战性:微调 主干网可能会降低原始 S2T 性能,而附加下游说话者会重新引入串行文本到语音瓶颈。我们推出了 PRIME-Speech,这是一种仅训练语音生成模块的冻结骨干 S2S 转换框架。 PRIME-Speech 将因果音频后解码器与冻结主干的中间隐藏状态同步,因此编解码器词元是从模型不断发展的推理轨迹而不是从完整的文本块生成的。后解码器使用混合隐藏状态、文本和音频历史调节,以及具有回合级音频 KV 缓存和位置重置的训练时间打包策略,可稳定多回合语音交互,而无需额外的多回合 S2S 训练数据。多词元预测进一步降低了有效编解码器预测率,并在不修改推理路径的情况下改善了第一音频延迟。在语音翻译、口语 QA、语音理解和多轮对话中,PRIME-Speech 保留了冻结骨干网的 S2T 行为,同时产生准确、低 WER 的口语响应。