论文
Mage-VL:一种高效的编解码器原生流多模态基础模型
Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model
摘要
标准视觉语言模型(VLM)遭受莫拉维克悖论的困扰:它们擅长复杂的离线视觉推理,但难以处理简单的流式感知任务,并且处理效率低下。我们提出了 Mage-VL,这是一种高效的编解码器原生流媒体基础模型,用于实时多模态理解和交互。其核心是,我们的自定义标记器 Mage-ViT 通过使用稀疏锚点 (I) 和预测 (P) 帧上的运动向量和残余能量选择性地编码动态、熵丰富的区域来取代均匀帧采样。在 16 x 16 补丁级别运行,这可以减少超过 75% 的视觉标记消耗,同时保留时空上下文。 Mage-ViT 在大约 5.6 亿未标记图像和 1 亿未标记视频帧上进行了从头开始的训练,其性能可与在数十亿图像文本对上训练的旗舰编码器相匹配或优于旗舰编码器。我们建立了 AI4AI 数据管道,包括多模态描述的提示代码联合优化和人工智能驱动的性能诊断,以指导训练方案。此外,通过仿生双系统架构 - 轻量级系统 1 事件门和因果系统 2 解码器 - Mage-VL 可实现主动流感知。广泛的评估表明,Mage-VL-4B 在静态任务上与 Qwen3-VL-4B 相匹配,同时在视频理解和 2D/3D 空间推理方面取得了巨大进步,挂钟推理加速高达 3.5 倍,全面超越 15B Phi-4 推理视觉基线。除了模型工件之外,我们还提供了七个关键的实证研究结果,涵盖 预训练 数据效率、可变分辨率缩放、编解码器系统加速、VideoQA SFT 冗余、运动空间协同、AI4AI 数据管道和多模态 RL 的零视觉 SFT。