论文

略读和跳过:用于高效多模态检索的分层自适应推理

Skim and Skip: Hierarchical Adaptive Inference for Efficient Multimodal Retrieval

模型推理推理加速

摘要

通用多模态检索 (UMR) 越来越多地采用多模态 大语言模型 (MLLM) 作为统一嵌入主干,但其强大的检索性能是以巨大的推理成本为代价的。现有方法通常依赖于均匀密集推理,其中所有输入标记都通过整个模型进行处理,并使用最后层 [EOS] 表示进行匹配。然而,这种范式忽略了多模态检索中异质性的两种关键形式:对最终检索嵌入的标记贡献非常不均匀,并且不同的查询需要明显不同的推理深度。为了解决这个问题,我们提出了 Skim and Skip (SAS),这是一种用于高效多模态检索的分层自适应推理框架。 SAS 首先执行 词元级 证据选择,仅保留与最终检索嵌入最相关的输入信息,然后执行深度自适应推理以确定当前表示是否足以进行可靠匹配。对 12 个 MMEB 检索任务的实验表明,SAS 保留了约 99% 的密集基线平均检索性能,同时实现了高达 1.64 倍的端到端加速和高达 66.3% 的 FLOPs 减少。