论文

VisionWeave:原生弹性视觉表示的多模态模型

VisionWeave: Weaving Elastic Visual Representations as a Native Capability of MLLMs

模型优化稀疏化

摘要

多模态语言模型以稠密固定大小patch词元编码输入,视觉理解成本较高。但视觉信息不均匀,有些区域需要细节,有些可用紧凑表示。降采样牺牲细节,已有剪枝和自适应方法在内容粒度、任务泛化及服务集成上受限。我们提出基础模型端到端学习视觉表示应分配在何处、采用何种粒度,称之为弹性视觉编织。VisionWeave通过大规模训练建立这项能力:门控空间池化在共享MRoPE坐标中构建与原生细粒表示并列的粗粒表示;粒度路由器学习按内容分配。只用自蒸馏,在Qwen3.5-4B验证,并以超过30,000 A100 GPU小时扩展到Qwen3.8-27B。后者平均节约43.0%视觉词元,在八基准保留98.9%原生表现;固定50%节约的剪枝基线只保留88%。多任务、分辨率和视频帧评测确认效率—质量权衡。SGLang部署中吞吐提高2.3倍,平均首词元时间降低54.4%,平均每输出词元时间降低60.6%。结果表明弹性视觉编织可能成为下一代多模态模型的原生能力。

VisionWeave:原生弹性视觉表示的多模态模型:论文原图
图 3:VisionWeave 整体架构。门控空间池化器在同一 MRoPE 坐标内用粗粒度表示 $V_{\mathrm{coarse}}$ 补充原生细粒度 token $V_{\mathrm{fine}}$,而粒度路由器自适应地将它们编织成 LLM 的混合粒度序列。