论文

UAF:面向全双工语音交互的统一音频前端大语言模型

UAF: A Unified Audio Front-end LLM for Full-Duplex Speech Interaction

模型架构新型架构

摘要

全双工语音交互作为人类最自然、最直观的沟通方式,正推动人工智能迈向更类人的对话系统。传统级联式语音处理流水线存在关键局限,包括延迟累积、信息丢失以及误差在模块间的传播。为解决这些问题,近期工作转向GPT-4o等端到端音频大语言模型(LLM),其主要是将语音理解与生成任务统一起来。然而,这些模型大多本质上是半双工的,并依赖一整套分离的、面向特定任务的前端组件,如语音活动检测(VAD)与轮次检测(TD)。在语音助手的研发中我们观察到,要实现无缝、即时的交互,优化语音前端与推进后端统一模型同等关键。为弥合这一缺口,我们提出首个面向全双工语音系统定制的统一音频前端大语言模型(UAF)。我们的模型将多样的音频前端任务重构为单一自回归序列预测问题,涵盖VAD、TD、说话人识别(SR)、自动语音识别(ASR)与问答(QA)。它以流式固定时长音频块(如600 ms)为输入,起始处利用参考音频提示锚定目标说话人,并自回归生成同时编码语义内容与系统级状态控制(如打断信号)的离散token。实验表明,我们的模型在多个音频前端任务上取得领先性能,并在真实交互场景中显著改善响应延迟与打断准确率。

UAF:面向全双工语音交互的统一音频前端大语言模型:论文配图
图1:对比UAF统一音频前端LLM与传统级联式全双工语音交互系统的两种架构。