论文

通过基于 LLM 的并行文本生成的低延迟实时音频游戏解说系统

Low-Latency Real-Time Audio Game Commentary System via LLM-Based Parallel Text Generation

模型推理批处理与并行

摘要

我们提出了一种低延迟实时音频游戏解说系统,可以直接从实时游戏视频生成语音解说。在这种端到端的设置中,一个关键的瓶颈是累积的等待时间;传统的管道为每个话语依次捕获帧、生成文本和合成语音,并且在语音播放完成之前不会请求下一代。这种严格的顺序导致话语之间出现长时间且不自然的沉默。为了解决这个延迟瓶颈,我们的系统与语音播放并行运行文本生成,并提前缓冲多个候选话语,从而能够在播放边界立即合成。对快节奏游戏视频的实验表明,与顺序基线相比,我们的并行设计将平均话语间沉默从 9.6 秒减少到 0.3 秒。它还将与专业演讲(静音计时模式)的相似度提高了 40% 以上,并且对 120 名经验丰富的游戏玩家进行的用户研究证实,感知的演讲节奏显着改善。我们的演示视频位于:https://youtu.be/pmrRUlvav8M。