论文
VisionWeave:原生弹性视觉表示的多模态模型
VisionWeave: Weaving Elastic Visual Representations as a Native Capability of MLLMs
摘要
多模态语言模型以稠密固定大小patch词元编码输入,视觉理解成本较高。但视觉信息不均匀,有些区域需要细节,有些可用紧凑表示。降采样牺牲细节,已有剪枝和自适应方法在内容粒度、任务泛化及服务集成上受限。我们提出基础模型端到端学习视觉表示应分配在何处、采用何种粒度,称之为弹性视觉编织。VisionWeave通过大规模训练建立这项能力:门控空间池化在共享MRoPE坐标中构建与原生细粒表示并列的粗粒表示;粒度路由器学习按内容分配。只用自蒸馏,在Qwen3.5-4B验证,并以超过30,000 A100 GPU小时扩展到Qwen3.8-27B。后者平均节约43.0%视觉词元,在八基准保留98.9%原生表现;固定50%节约的剪枝基线只保留88%。多任务、分辨率和视频帧评测确认效率—质量权衡。SGLang部署中吞吐提高2.3倍,平均首词元时间降低54.4%,平均每输出词元时间降低60.6%。结果表明弹性视觉编织可能成为下一代多模态模型的原生能力。
