论文
WavAlign:通过自适应混合后训练提升语音对话模型的智能与表现力
WavAlign: Enhancing Intelligence and Expressiveness in Spoken Dialogue Models via Adaptive Hybrid Post-Training
摘要
端到端语音对话模型因在表现力与感知能力上具有比级联系统更高的潜在上限而备受关注。然而,当前开源语音对话模型的智能与表现力往往低于预期。受在线强化学习(RL)在其他领域成功的启发,人们可能尝试将偏好优化直接应用于语音对话模型,但这一迁移并非易事。我们从奖励建模与rollout采样两个角度分析这些障碍,重点关注稀疏的偏好监督在共享参数更新下如何与稠密的语音生成相互作用。基于该分析,我们提出一种模态感知的自适应后训练配方,使RL在语音对话中切实可行:它将偏好更新约束在语义通道,并通过显式锚定改善声学行为,同时根据rollout统计量动态调节二者的混合比例,以避免不可靠的偏好梯度。我们在多个语音对话基准与代表性架构上评估该方法,观察到语义质量与语音表现力的一致提升。
