论文

用于通过语音服务 LLM 的可扩展上下文编排

Scalable Context Orchestration for Serving LLMs Over Voice

上下文与知识上下文工程

摘要

随着 大语言模型 (LLM) 的进步使语音交互变得更加自然和易于访问,语音 AI 应用程序越来越受欢迎。为这些应用程序提供服务不仅需要考虑用户所说的内容,还需要考虑他们说话的方式(例如语速)以及捕获和传输音频的条件(例如背景噪声和数据包丢失)。然而,现有的 LLM 系统将对话上下文表示为扁平的、不断增长的消息序列,将特定于语音的上下文隐含在音频中。因此,它们可能会生成与用户偏好不太相符的响应,在不利的环境条件下降低交互质量,并在长时间的语音会话中产生高昂的成本。我们推出了 llmovoice,这是一个上下文管理中间件,可以显式地模拟语音上下文并协调其使用。在每个回合,llmovoice 都会根据当前用户输入、相关交互历史记录以及明确的副语言和环境状态构建有界语音上下文。然后,它使用服务 LLM 对此上下文进行推理并生成指导系统如何响应的运行时指令。我们根据现实世界的语音应用程序和基准评估 llmovoice。语速对齐误差降低52.4%,丢包情况下误插率从46.0%降低到0.9%,模型使用成本降低79.2%。对于长时间会话,llmovoice 可将每轮成本降低高达 24.9 倍,同时保留高达 98.7% 的基线答案质量。