论文
随机中间引导:用真实对话训练串联语音模型
Learning Natural Conversational Behavior in Tandem Speech-to-Speech Models with Randomized Guidance
摘要
串联语音到语音架构将响应式语音前端与异步文本后端结合起来。在 KAME 中,大型语言模型 (LLM) 作为后端,在用户仍在说话时提供候选响应作为语音前端的指导。普通的对话录音会捕获最终的响应,但不会捕获后端在用户说话期间提供的指导。在真实对话训练时,使用模拟器 LLM 生成缺失的指导会增加大量的数据准备开销。我们提出了随机中间指导,它直接从对话语料库中获取指导,而不是模拟后端 LLM 行为。在训练期间,目标响应提供信息指导,而随机采样的响应在说话期间提供可能不相关的更新。这种组合的目的是教前端有选择地使用后端信息。在合成对话中,使用此方法训练的 KAME 达到了与 LLM 生成的基于相似性的基线相当的响应质量。与合成数据 KAME 相比,经过 3800 小时的真实对话训练可以提高轮次衔接的流畅度和音频判断的自然度,同时保留相对于 Moshi 的响应质量优势。这些结果表明,随机指导提供了一种实用途径,可以将串联模型的响应质量优势与从真实语音中学习到的自然会话行为相结合。