论文
UltraViT:适用于大型视觉语言模型的延迟优化设备端视觉编码器
UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models
摘要
大型视觉语言模型 (LVLM) 仍然受到大量计算占用的瓶颈,阻碍了它们在资源受限的边缘设备上的部署。虽然压缩 LVLM 的努力主要集中在视觉标记减少或更小的语言模型上,但视觉编码器在很大程度上被忽视,通常部署为整体的、计算量大的特征提取器。此外,之前还没有为 LVLM 设计视觉编码器来直接针对设备上的延迟进行优化。在本文中,我们介绍了 UltraViT,一种用于 LVLM 的视觉编码器,针对设备性能进行了明确设计和优化。具体来说,通过考虑实际的设备上延迟,我们系统地设计了一种金字塔架构,该架构在宏块级别上战略性地集成和适应异构空间混合器。此外,为了预训练 UltraViT,我们提出了一种新颖的两阶段生成 预训练 策略:通过密集的 蒸馏 培养丰富的空间特征,然后从容量混合的冻结 LLM 进行直接生成监督。与标准对比和 SSL 相比,我们表明我们的 预训练 在实现后续 LVLM 训练的生成多模态对齐所需的 UltraViT 高级语义基础方面要有效得多。大量实验表明,我们的设备上延迟通知设计与我们量身定制的训练策略相结合,为高效 LVLM 编码建立了一种新的最先进技术,显着优于现有的以编码器为中心的基线,同时在设备上以近 1.7 倍的速度运行。