论文
面向交互式语音对话模型语义与轮次时机鲁棒性的双轴生成式奖励模型
Dual-Axis Generative Reward Model Toward Semantic and Turn-taking Robustness in Interactive Spoken Dialogue Models
摘要
实现无缝、拟人化的交互仍然是全双工语音对话模型(SDM)的关键挑战。强化学习(RL)已大幅增强了文本与视觉语言模型,而精心设计的奖励信号对RL性能至关重要。我们认为RL是解决SDM这一关键挑战的有前景策略。然而,一个根本障碍依然存在:当前用于评估交互质量的自动化指标依赖行为统计或时机预测精度等浅层代理,无法为RL提供可靠的奖励信号。另一方面,人工评估虽然内容丰富,但成本高、结果不一致且难以规模化。我们通过提出双轴生成式奖励模型来攻克这一关键障碍:该模型借助细粒度分类体系与标注数据集训练以理解复杂交互动态,输出单一分数,且至关重要的是,对语义质量与交互时机分别给出评估。这种双路输出为SDM提供精确的诊断反馈,并给出适合在线强化学习的、可靠且具指导意义的奖励信号。我们的模型在覆盖合成对话与复杂真实交互的广泛数据集上,于交互质量评估任务取得最先进的性能。
