论文
LLaVA-UHD v4:什么使 MLLM 中的视觉编码更加高效?
LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?
摘要
视觉编码构成了多模态 大语言模型 (MLLM) 的主要计算瓶颈,特别是对于高分辨率图像输入。流行的做法通常采用全局编码,然后进行 ViT 后压缩。全局编码会产生大量词元序列,而 ViT 后压缩会在发生任何词元减少之前产生 ViT 的全部二次注意力成本。在这项工作中,我们从两个维度重新审视这一约定:编码策略和视觉标记压缩。首先,对照实验表明,基于切片的编码在基准测试中优于全局编码,这表明通过切片视图保留局部细节比应用全局注意力来实现细粒度感知更有益。其次,我们引入了 ViT 内早期压缩,这减少了浅 ViT 层中的词元,并显着降低了视觉编码 FLOP,同时保留了下游性能。通过将 ViT 内压缩集成到基于切片的编码框架中,我们提出了 LLaVA-UHD v4,这是一种专为高分辨率输入量身定制的高效且计算可控的视觉编码方案。在涵盖文档理解、OCR 和一般 VQA 的各种基准测试中,LLaVA-UHD v4 将视觉编码 FLOP 降低了 55.8%,同时匹配甚至超越了基准性能。这些结果表明,在不牺牲下游性能的情况下,可以大幅提高视觉编码效率,为高效的高分辨率 MLLM 提供实用的设计方向。所有模型权重和代码都将公开发布以支持进一步的研究。