论文

用于统一音频理解和生成的基于 vLLM 的高效推理管道

An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation

AI 基础设施推理服务

摘要

虽然大型多模态模型在理解方面表现出色,但高吞吐量推理引擎缺乏对多模态生成的原生支持。这在语音语言模型中非常严重,其中通过解耦的 AR+NAR 或具有延迟模式交错的同步多词元预测 (MTP) 生成多层音频词元与标准单流循环发生冲突。我们提出了一个基于 vLLM 的推理管道,用于统一语音理解和生成。我们扩展了自回归解码,以本机执行延迟模式解交织和协调多流采样,集成 GPU 上的声学解码器以进行端到端波形合成。至关重要的是,我们克服了无分类器指导 (CFG) 会使吞吐量减半的共同直觉。通过在连续批处理中共同调度成对的条件和无条件请求,我们的 CFG 实现可维持非 CFG 吞吐量的 80%,吸收双请求和 logits 合并开销。我们开源我们的框架。