论文
miniReranker:通过视觉缓存重用和交互稀疏性进行高效的多模式重排序
miniReranker: Efficient Multimodal Reranking through Visual Cache Reuse and Interaction Sparsity
摘要
多模态 大语言模型 (MLLM) 最近通过下一个标记预测直接建模查询文档相关性,显示出作为逐点重新排序器的强大潜力。然而,逐点重新排序会受到跨查询-文档对的大量重复计算的影响,而 Transformer 的因果结构仅允许通过预缓存重用前缀段。为了解决现有查询优先和文档优先格式与 VQA 风格的提示和计算感知重用的不一致问题,我们提出了 $\textit{vision-first}$ 公式,该公式可以提高缓存重用效率和重新排序性能。然而,剩余的成本仍然相当可观,并且源于三个主要来源:(1)$\textit{模型深度}$,为此我们通过提前退出来减少活动参数; (2) $\textit{跨段注意力}$,我们将其限制在跨几个层的狭窄交互带内; (3) $\textit{视觉标记}$,我们通过嵌入器引导的修剪来减少标记的数量。这些设计共同形成了 miniReranker,它在单个查询的高重用设置下将重新排序运行时间减少到密集实现的 1% 以下,同时保留超过 96% 的密集模型性能。