论文

HiPLEX:全双工语音模型的分层策略分解

HiPLEX: Hierarchical Policy Factorization for Full Duplex Speech Language Models

模型训练强化学习

摘要

随着人类与人工智能的交互变得更加会话化,能够进行自然实时对话的全双工语音语言模型变得越来越重要。除了生成适当的响应之外,这些模型还必须实时协调轮流、反向渠道和场地管理。强化学习 (RL) 提供了一种通过对交互结果的直接反馈来完善这些行为的方法。然而,现有的强化学习方法要么将时序反馈应用于 token 策略,要么优化语义内容,而未能解决时序和内容的联合改进问题。我们引入了 HiPLEX,这是一个 RL 框架,它将预训练的全双工文本策略分解为决定何时发出内容的控件策略和决定发出内容的条件内容策略。第一个因素在“pad”、“epad”和“con”之间进行选择。仅当选择“con”时,第二个才选择 token。该层次结构描述了每个帧内的条件操作,并使用模型的现有文本头。我们通过从生成的语音片段派生的事件因果掩码将时间优势路由到 token 组因子,并将 LLM 判断语义优势路由到条件内容因子。在 Full-Duplex-Bench v1 上的三个 Moshi 种子中,HiPLEX 降低了自然用户暂停和反向通道机会期间的接管率,并缩短了相对于 GRPO 的中断后响应延迟,同时保持了可比较的判断中断响应质量。在 Moshi 和 PersonaPlex 上,HiPLEX 比 GRPO 更好地匹配汇集的人类轮次计时和反向通道速率边缘。

HiPLEX:全双工语音模型的分层策略分解:论文原图
图 1:HiPLEX 中的时序和语义信用分配。 (a) LLM 法官评估回答的相关性和连贯性。 HiPLEX 对每个 执行轨迹 组内的这些分数进行标准化,并仅在 $c_{t}=\mathrm{cont}$ 的情况下将语义优势应用于条件内容策略。 (b) 主动交互类型的时序组件单独标准化,事件因果掩码将其优势路由到控制决策。每个单元代表一个 80 毫秒的帧。