论文
VEN-VL:用于有效和高效多模态理解的视觉集成教育部框架
VEN-VL: A Visual Ensemble MoE Framework for Effective and Efficient Multi-Modal Understanding
摘要
尽管最近的有效方法在加速多模态理解方面取得了显着进展,但它们仍然存在明显的性能下降。他们强调单个视觉线索的高压缩比,并依赖粗注意力对齐的启发式修剪策略,这导致了视觉标记的信息容量和密度的瓶颈。为了解决这一限制,我们提出了 VEN-VL,一种视觉集成 MoE 框架,用于遵循先丰富后紧凑的原则,实现有效和高效的感知。具体来说,我们首先通过统一不同视角的视觉表示来丰富信息容量,然后通过专门的视觉专家中的自适应路由器逐步压缩它以增强信息密度。此外,我们通过明确的视觉监督结合了香草结构的重建能力,促进了关键信息的保存。实验结果证明了我们在复杂的视觉任务中具有很少的信息压缩标记的优势,这有效地弥合了性能和效率之间的差距。