论文
DuplexSLA:具有同步语音、语言和动作的全双工口语模型
DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action
摘要
口语对话语言模型的最新进展已从基于回合的设计转向全双工设计,其中模型在生成响应的同时不断倾听用户的声音。然而,现有的双工主干仍然缺乏用于对话中规划和工具调用的本地通道,使得实时代理行为要么与转弯边界相关,要么被降级到外部级联。我们提出了 DuplexSLA,这是一种本机全双工语音-语言-动作基础模型,可在共享的 160 毫秒块时间线上解码助理音频和结构化动作流。 DuplexSLA 基于双流三通道公式构建:一个连续的用户音频通道、一个离散的辅助音频通道和一个速率限制的文本操作通道,所有这些通道均由单个骨干网联合解码,以便听、说、计划和工具调用在一个共享时钟上展开。两个功能定义了该模型:(1) 语义驱动的轮流控制,其中中断、暂停和反向通道在同一主干内处理,而不是由外部语义 VAD 处理; (2) 对话中规划和工具调用,其中规划文本和结构化工具调用在动作通道上发出,而不停止助理音频,以便多动作和反向通道触发的工具使用与正在进行的语音交织在一起。为了一起评估这些功能,我们进一步构建了 DuplexSLA-Bench,这是一个双工基准,涵盖暂停、中断和反向通道轮流以及三种风格的对话中工具调用。我们的项目页面、交互式演示和 DuplexSLA-Bench 评估套件可在 https://github.com/hyzhang24/DuplexSLA 上公开获取。