论文

Context Spanning:向全双工语音模型实时注入外部信息

Context Spanning: A Communication Framework for Full-Duplex Speech Models and External LLM Backends

应用与实践上下文与知识上下文工程语音交互与综合语音服务

摘要

全双工语音对话模型可以像人类对话的实时动态一样同时听和说。对于自然对话来说,实时搜索外部信息的能力也是一项重要能力。许多模型仍然受困于参数化知识,导致它们无法访问实时信息和工具执行。此外,即使大语言模型 (LLM) 检索信息,许多双工语音模型也会在压缩的潜在空间中而不是以原始文本形式处理信息,这可能会导致压缩导致信息丢失。为了解决这个问题,我们提出了 Context Spanning,这是一种通过实时分块预填充在全双工语音模型和外部 LLM 后端之间注入信息的框架。注入的帧在实时帧预算内的单个前向传递中进行编码。它将检索到的信息按原样提供给语音模型,使其能够独立推理信息并生成响应。通过这种方法,我们的模型在全双工基准测试中实现了高性能,并在问答任务中取得了出色的结果,展示了其对话潜力。上下文跨越表明外部信息可以直接注入双工语音模型,为双工系统引入一种新的简单而强大的机制。