论文
DuplexPO:用强化学习分离全双工语音模型的说话时机与内容
Decoupling Conversational Dynamics in Full-Duplex Spoken Models through Reinforcement Learning
摘要
全双工语音对话模型可以低延迟响应、给出回应式附和并处理用户插话,但交互时序改善有时伴随推理和指令遵循能力下降。论文认为二者不必形成根本取舍,可从人类对话数据单独学习实时交互策略。DuplexPO把何时说话与说什么分离,保留经指令调优助手的语义响应能力,只在长对话中选定的关键窗口优化交互时序。分解式对话动态奖励FCDR分别评价话轮启动、回应式附和、让出话轮和受正则约束的参与,以提供细粒度时间贡献分配,再用GRPO式目标训练策略。实验改善及时附和、平滑话轮切换及用户打断处理,同时保持较强推理和指令遵循能力;时序指标改善也对应更好的用户体验。