论文
GRIP:大型多模态模型的反馈引导提示检索
GRIP: Feedback-Guided Prompt Retrieval for Large Multimodal Models
摘要
情境学习(ICL)已成为一种强大的机制,可以使 大语言模型(LLM)适应没有 微调 的新任务。将此概念扩展到大型多模态模型 (LMM),多模态上下文学习 (M-ICL) 依靠检索相关示例(例如图像、说明文字或问答对)来指导分类、说明文字和视觉问答 (VQA) 等任务的预测。大多数现有方法基于特征空间相似性来选择上下文中的示例,假设语义相似的样本提供最有用的上下文。然而,我们的系统分析表明,这一假设并不总是成立:视觉上相似的例子不一定是那些最有效地提高情境学习表现的例子。为了解决这个问题,我们提出了上下文提示的引导检索(GRIP),这是一种可学习的仅视觉检索框架,它利用 LMM 的反馈来识别真正改进模型预测的示例。 GRIP 通过对比训练学会区分上下文中有益和有害的示例,从而超越纯粹的相似性精炼检索。在分类、图像描述和 VQA 三个多模态任务中,GRIP 相对于 Qwen2.5-VL-7B 上基于相似性的检索得到了一致的改进,其中在 Idefics2-8B 上的分类方面取得了最大的进步。此外,我们证明,利用一个开放 LMM 的反馈进行训练的 检索器 可以转移到其他模型,而无需重新训练,包括闭源 GPT-4o 和 Gemini,从而实现 M-ICL 的可扩展且经济高效的部署。代码将在接受后发布。