论文
LookME:基于查找的多模态嵌入,用于视觉语言模型中的层注入
LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models
摘要
视觉语言模型(VLM)在多模态理解方面取得了长足的进步。然而,扩展密集或稀疏专家混合 (MoE) 模型以提高性能会限制资源受限环境中的部署,因为需要在完全加载的高内存使用率和按需加载增加的延迟之间进行权衡。最近,每层嵌入 (PLE) 架构通过使用存储在只读存储器 (ROM) 中的大型外部嵌入表来扩展模型并执行轻量级查找以检索相关嵌入以增强词元表示来解决此问题。然而,由于基于 ID 的检索的便利性,现有的 PLE 风格的方法主要是为文本嵌入而设计的,这限制了它们在 VLM 中的有效性,其中多模态嵌入包含更丰富的视觉任务信息。在本文中,我们提出了 LookME,这是第一个能够在 VLM 中实现基于查找的多模式嵌入增强的框架,同时支持分区存储和按需加载。为了从大规模嵌入表中有效地查找任意连续多模态嵌入,我们提出了一种分层两级查找方法,采用从粗到细的策略,执行从场景级到场景内基元级的查找。此外,我们将查找方法与稀疏注入策略相结合,该策略自适应地将关键嵌入优先于层内的大量多模态嵌入,并促进相邻层之间的嵌入表重用,从而改善效率、模型大小和性能之间的权衡。多个视觉基准的实验表明,LookME 优于纯文本 PLE 风格的方法,验证了基于查找的多模态嵌入增强的有效性。