论文

全双工语音模型中的多方面交互对齐

Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models

模型训练强化学习

摘要

全双工口语对话模型可以同时听和说,这使它们成为自然对话的有前途的架构。然而,当前的模型仅通过 词元级 似然最大化进行监督学习进行训练,这并不能直接优化交互级别的行为,从而导致过度沉默和不合时宜的轮流等交互问题。最近的工作应用强化学习(RL)来提高交互性,但现有方法仅解决奖励中有限的一组交互行为。在这项工作中,我们提出了一种 后训练 对齐方法,通过 RL 全面提高全双工口语对话模型的交互性。我们讨论了交互性的四个典型轴:暂停处理、轮流、反向通道和用户中断。对于每个轴,我们从人类对话语料库中提取短音频片段,并使用特定于轴的奖励函数优化模型。基于 LLM 的额外响应质量奖励可防止语义退化。我们将我们的方法应用于两个开源模型 Moshi 和 PersonaPlex,在使用预先录制的音频的离线评估和实时多轮对话评估方面展示了交互性的一致改进。