论文

LLM 说话时应该如何听?全双工语音对话中用户流路由的研究

How Should LLMs Listen While Speaking? A Study of User-Stream Routing in Full-Duplex Spoken Dialogue

模型架构Transformer

摘要

全双工语音对话要求模型生成语音时继续听取用户输入,而为延续单一连贯序列设计的大语言模型并不天然支持生成中到达的新输入,因此用户流如何接入模型是关键架构问题。研究将纯文本模型扩展为统一的全双工语音对话系统,在共享训练流程中比较两种策略:通道融合将用户流直接加入模型输入;交叉注意力接入将用户流保留为外部记忆,经交叉注意力适配器访问。语音问答及全双工交互基准显示明确的权衡:通道融合的语义关联更强、问答持续更好,但在插话等语义重叠条件下,若模型未及时停下,用户流会干扰当前生成,产生语义不连贯的后续内容。交叉注意力方案问答较弱,却更好地保留生成上下文,对该故障更稳健。结果将用户流接入方式确立为全双工对话的重要设计维度,并给出语义整合与上下文鲁棒性的实践取舍。论文提供演示页面供定性检查。