论文

SteerDuplex:可调控的双工语音对话模型

SteerDuplex: Steerable Duplex Speech Dialogue Models

模型训练强化学习

摘要

全双工语音对话模型支持低延迟的轮流发言、中断处理和反馈机制,但一项关键能力仍被忽视:可调控性,即能够根据用户指令可靠地调整对话的语气、角色、语速和语音风格。我们提出了文本和音频两种基于指令的可调控性分类,揭示了当前全双工模型在该方面的显著不足。为解决这一问题,我们提出SteerDuplex,一种基于Moshi架构的全双工语音模型,通过在自然对话和合成对话上进行微调,提升指令遵循、语音表达、推理和双工交互能力。我们进一步采用两阶段强化学习(RL)结合混合奖励机制,融合可验证的交互检查和基于评委的语义反馈,以优化响应时机和连续性。为评估全双工语音的可调控性,我们提出SteerBench基准,包含390个语音指令和1,067条由人类撰写的二元音频与文本评分标准,覆盖语气、角色、风格/口音、语速/时长等维度。在SteerBench上,监督训练使音频调控的平均通过率相比最强的开源基线提升44.5个百分点。在Audio MultiChallenge任务上,平均通过率相比最强开源基线提升7个百分点。强化学习进一步将源端干净中断响应率从72.5%提升至82.5%,并将合成停顿的误插入率从26.5%降低至9%。在调控和整体任务表现上保持相当或更高水平,但奖励探针显示存在通过不完整响应实现奖励劫持的现象。本模型和基准支持系统性研究语音可调控性,奖励分析表明,提升响应时机必须与响应完整性同步评估。

SteerDuplex:可调控的双工语音对话模型:论文配图
图1:全双工语音对话能力分类,区分自然语言引导、声音理解与适应,以及一般双工交互。示例仅为示意,并非模型输出或延迟测量。该分类覆盖的设计空间大于当前基准:SteerBench测试语气、人设、风格/口音、速度/长度等内容与表达要求,AudioMC、VoiceBench与FDB补充任务及交互评估。