论文
MAViE:用于细粒度视觉感知和高效多模态推理的多尺度自适应视觉编码器
MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning
摘要
视觉语言模型通常将预训练视觉编码器生成的所有标记投影到 大语言模型 中。然而,最终层特征可能会丢弃文本、局部属性和空间关系,而高分辨率输入会大大增加上下文长度和推理延迟。我们引入\method,一种多尺度自适应视觉编码器。 \方法使用位置相关的门来融合来自视觉 Transformer 的浅层、中间和深层特征,保留全局语义,同时增强边缘、文本和局部结构。然后,它根据问题相关性、局部信息内容、全局语义和空间覆盖范围,使用适应图像复杂性的 词元预算 执行问题条件标记路由。为了减轻压缩损失,我们进一步引入了全压缩表示 蒸馏 和空间分集正则化器。在统一 7B 语言模型框架下的说明性模拟中,该方法将 SigLIP-SO400M 视觉标记的平均数量从 729 个减少到 146 个(大约 80.0%),并将 VQAv2、GQA、TextVQA、ScienceQA-IMG 和 MMBench 的平均分数提高了 2.2 个百分点,同时将单图像到第一个标记的时间从 228ms 减少到129、女士。我们提供完整的模型设计和评估协议。目前所有报告的数字仅用作论文组织和实验设计的占位符;正式声明需要真实的训练运行、独立的复制和官方基准评估。