论文

DuplexCadence:按语音模型原生时钟分配状态与执行图

DuplexCadence: Exact State and Execution from a Speech Model's Declared Timelines

模型推理推理加速

摘要

全双工语音模型支持同时聆听与说话的流式交互。服务它们必须遵守严格、重复的截止时间:对话按一秒节拍推进,每秒输入必须在下一秒到来前转成一秒语音。会话内各阶段严格顺序执行,单次调用开销无法通过批处理消除。性能分析显示,一个双工秒内的自回归阶段已经能够在周期内完成,导致超时的是词元到音频的合成尾部。这个阶段存在编排空隙:成千上万个细小且规律的操作逐一发出,GPU因此等待;同时,按照静态实现常量过度配置状态也浪费大量内存。图录制和按需分配等现有方法因为流式状态动态变化不满足其前提而失效。根本原因是运行时缺少模型的原生时钟,即控制各区域推进速度与保留策略的计数器。我们提出DuplexCadence,向运行时显式声明原生时钟,并推导出两个相互支持的规则:在稳定地址上按需分配状态,以及无需填充的精确形状图重放。前者消除闲置内存并稳定张量指针,后者在不增加填充开销的情况下消除编排空隙。在三种解码器架构的四个已发布模型上,输出逐比特一致时,DuplexCadence达到原始运行时2.85倍的速度,峰值内存降低38.8%。在实时双工路径上,平均SPEAK耗时从超过一秒节拍14%降至低于节拍2%,使模型能够可靠跟上交互语音,并显著扩大多会话服务容量。