论文

解放全双工语音模型中的 LLM 功能

Liberating LLM Capabilities in Full-Duplex Speech Models

应用与实践语音交互与综合语音服务

摘要

基于语音的 大语言模型 通常仅限于口头回复,这将其面向用户的输出限制为可以用语言表达的内容,并抑制了文本本机功能,例如实时交互中的代码生成、结构化分析和多步推理,适用于需要持久、结构化和可检查中间输出的任务。现有的工作改进了口语推理或全双工轮流,但仍然将文本视为隐藏的中间状态或从属模态,而不是一流的输出通道。我们提出听-写-说(LWS),这是一种文本优先的三通道范例,其中单个自回归 LLM 连续收听用户音频,写入可见的自由格式文本作为其主要输出,并在共享因果注意力上下文下并行说出实时口头响应。此行为完全通过词元模式实现,不需要架构修改,并通过两阶段数据管道学习,该管道合成与显示的输入时间线一致的每秒认知注释。根据经验,LWS 在 Full-Duplex-Bench 上展示了强大的全双工交互,在 VoiceBench AlpacaEval 上达到 4.72,实现了 92.6% 的写语一致性,并且在 URO-Bench 上始终优于其内部消融。这些结果表明,可见书写可以作为语音交互的一流输出渠道,而无需牺牲实时响应能力。代码和数据集可在项目页面上找到:https://royalzhang.com/project/lws-page/。