论文
MoshiRAG:全双工语音语言模型的异步知识检索
MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models
摘要
最近出现的语音到语音语言模型可以增强对话式人工智能的自然性。特别是,全双工模型以其实时交互性而著称,包括暂停、中断和反向通道的处理。然而,提高其真实性仍然是一个公开的挑战。虽然扩展模型大小可以解决这一差距,但它会使实时推理成本过高。在这项工作中,我们提出了 MoshiRAG,这是一种模块化方法,它将紧凑的全双工接口与选择性检索相结合,以访问更强大的知识源。我们的异步框架使模型能够识别需要知识的查询并将其响应基于外部信息。通过利用响应开始和核心信息传递之间的自然时间间隙,可以在保持自然对话流的同时完成检索过程。通过这种方法,MoshiRAG 实现了与最佳公开发布的非双工语音语言模型相媲美的事实性,同时保留了全双工系统固有的交互性。此外,我们灵活的设计支持即插即用的检索方法,无需重新训练,并在域外数学推理任务上表现出强大的性能。