论文

ASPIRin:全双工语音语言模型中交互优化强化学习的动作空间投影

ASPIRin: Action Space Projection for Interactivity-Optimized Reinforcement Learning in Full-Duplex Speech Language Models

模型训练强化学习

摘要

端到端全双工语音语言模型 (SLM) 需要精确轮流才能实现自然交互。然而,通过标准原始词元强化学习(RL)优化时间动态会降低语义质量,导致严重的生成崩溃和重复。我们提出了 ASPIRin,这是一个交互性优化的 RL 框架,它明确地将何时说话与说什么内容解耦。使用动作空间投影,ASPIRin 将文本词汇映射到粗粒度的二元状态(主动语音与非主动沉默)。通过应用组相对策略优化 (GRPO) 和基于规则的奖励,它可以平衡用户中断和响应延迟。实证评估表明 ASPIRin 优化了轮流、反向通道和暂停处理方面的交互性。至关重要的是,与标准 GRPO 相比,将时间与标记选择隔离可以保持语义一致性,并将重复 n-gram 的部分减少 50% 以上,从而有效消除退化重复。