论文

Metronome:限制缓存,保持实时交互模型服务的节拍

Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving

AI 基础设施推理服务

摘要

实时交互模型——Moshi、MiniCPM-o、Qwen-Omni——将服务转变为周期性实时任务:在每一帧上,会话都会摄取流媒体音频,并且必须在重复的挂钟截止日期前做出响应,而其 KV 缓存单调增长并在整个对话中保持固定。这种机制隐藏着一种危险的故障模式。在真正的全双工堆栈上,持续负载不会优雅地降低服务质量:当累积的会话状态耗尽 KV 池时,它会从悬崖上掉下来,从每帧毫秒级跳到停滞的引擎。崩溃是亚稳态的——相同的五分钟运行崩溃或在运行差异中幸存——而且是无声的:延迟和截止日期错过指标自始至终都保持健康。我们证明了一个举措可以恢复稳定性和可观察性:绑定每个会话的驻留状态,并且延迟开始说明真相。 Metronome 的引擎内 KV 窗口消除了崩溃(0/20 与 14/20 跨两个批次运行),并将每帧延迟转变为单调负载信号,在线准入控制器在该信号上发现可调度并发;如果没有窗户,相同的控制器就会过度进入墙壁。一阶模型预测标题模型的崩溃时间在百分之几内,质量探针通过消融验证边界的设计:仅窗口在基于轮次的解码中是无质量的,并且其少数固定的注意力集中标记是保持自由运行的一代健康的原因。所有内容均通过真实音频、在一个 GPU 上的四种交互模型进行端到端测量。