论文
SteerablePlex:我们可以操纵全双工模型吗?
SteerablePlex: Can We Steer Full-Duplex Models?
摘要
全双工语音模型可以同时听和说,从而实现自然交互,但随着对话历史记录的增长而变得越来越难以控制。当用作用户模拟器时,缺乏控制可能会导致它们偏离规定的场景并产生不可靠的评估结果。我们引入了 SimIF-Bench(模拟器指令遵循基准),它评估会话模型是否保持在规定的场景内并按要求的顺序完成多个目标。该基准测试表明,当前的开源全双工模型很难遵循这些限制。然后,我们引入了一种基于群体奖励解耦标准化策略优化(GDPO)的训练方法,该方法使全双工模型能够在正在进行的对话期间遵循文本指令,同时保持其轮流能力。通过将生成的 SteerablePlex 连接到监控对话并在需要时提供指令的异步后端语言模型,我们构建了一个更可控的全双工用户模拟器,如下所示 多阶段约束比现有的开源模型和 GPT-Realtime 更可靠。