论文

Zamba2-VL 技术报告

Zamba2-VL Technical Report

模型架构混合架构

摘要

我们推出了 Zamba2-VL,这是一套基于 Zamba2 构建的视觉语言模型,Zamba2 是一种混合语言模型架构,将 Mamba2 状态空间层与少量共享 Transformer 块相结合。在广泛的图像理解、推理、OCR、定位和计数基准方面,Zamba2-VL 与同等规模的领先的基于 Transformer 的开放权重 VLM(包括 Molmo2、Qwen3-VL 和 InternVL3.5 系列)具有竞争力,并且大大优于先前基于 SSM 的混合 VLM,例如 VL-Mamba、Cobra 和 mmMamba。 Zamba2-VL 继承了 Zamba2 主干的近线性预填充计算和小型、近乎恒定的循环状态,在匹配的参数规模下,Zamba2-VL 的首次词元时间 (TTFT) 比这些 Transformer 基线低大约一个数量级,在与设备上和边缘部署最相关的较小 1.2B 和 2.7B 规模上,效率差距最为明显。我们在 https://huggingface.co/collections/Zyphra/zamba2-vl 上发布了三个模型 - 1.2B、2.7B 和 7B - 以及推理代码。