论文

M*:用于多模式模型的模块化、可扩展的服务系统

M*: A Modular, Extensible, Serving System for Multimodal Models

AI 基础设施模型服务框架

摘要

我们正在进入复合模型架构的新时代,该架构集成了不同的组件,例如视觉编码器、语言骨干、扩散和流头、音频编解码器、动作生成器和世界模型预测器。此类架构支撑着广泛的多模态模型,包括统一多模态模型、全向模型、语音语言模型、视觉语言动作策略和世界模型。然而,现有的模型服务框架是建立在对模型结构的狭隘假设之上的,这使得它们不适合适应这种新的架构多样性。在这里,我们提出了 M*,一个用于高效服务复合 AI 模型的通用服务系统。 M* 将模型表示为数据流图,将跨越不同模式的请求和任务表示为对这些图的遍历。核心见解是模块化抽象,支持模型组件的任意组合、灵活放置到物理集群上以及分布式运行时中与模型无关的优化。我们将这种抽象称为步行图,并展示它如何简洁地捕获来自广泛系列的复合模型。我们在代表性模型上实例化 M*,发现对于 BAGEL 上的文本到图像工作负载,它的端到端延迟平均比 vLLM-Omni 低 20%,同时为 Qwen3-Omni 上的文本到语音工作负载提供高达 2.9 倍的实时系数降低和 2.7 倍的吞吐量提升。 M* 的机器人规划性能也比 V-JEPA 2-AC 采样轨迹基线高出 12.5 倍。因此,我们的工作为以最少的开发人员工作量更有效地服务复杂模型铺平了道路。