论文
SLQ:通过共享潜在查询桥接模式以使用冻结的 MLLM 进行检索
SLQ: Bridging Modalities via Shared Latent Queries for Retrieval with Frozen MLLMs
摘要
多模态 大语言模型 (MLLM) 拥有内在推理和世界知识能力,但使其适应密集检索仍然具有挑战性。现有方法依赖于侵入性参数更新,例如完整的 微调 和 LoRA,这可能会破坏预先训练的语义空间并损害推理所必需的结构化知识。为了解决这个问题,我们提出了 SLQ,这是一种参数高效的调整框架,它可以适应 MLLM 进行检索,同时保持主干网完全冻结。 SLQ 引入了一小组附加到文本和图像标记的共享潜在查询,利用模型的本机因果注意力将多模态上下文聚合到统一的嵌入空间中。此外,为了更好地评估表面模式匹配之外的检索,我们构建了 KARR-Bench,这是一个专为知识感知推理检索而设计的基准。大量实验表明,SLQ 在 COCO 和 Flickr30K 上的性能优于完整的 微调 和 LoRA,同时在 MMEB 上实现了有竞争力的性能,并在 KARR-Bench 上产生了显着的收益,验证了通过非侵入性适应保留预训练表示是基于 MLLM 的检索的有效策略。该代码位于:https://github.com/CnFaker/SLQ。