论文

MAG:MAnifold 引导半监督多模式情境学习

MAG: MAnifold Guided Semi-Supervised Multi-modal In-Context Learning

上下文与知识上下文工程

摘要

具有多模态 大语言模型 (MLLM) 的少样本上下文学习 (ICL) 可以在不更新参数的情况下实现任务适应,但其性能对所选演示的质量和覆盖范围高度敏感。虽然未标记的多模态数据非常丰富,但如何将它们用于 ICL 仍然难以捉摸。我们提出 MAG(MAnifold 引导的半监督上下文演示选择),这是一种利用未标记数据来改进多模态 ICL 的有效框架。 MAG 将示范选择制定为多模态图上的半监督传播问题,并采用两阶段策略:(i)相关性得分传播识别一组紧凑的高影响力未标记样本以进行伪标记,从而降低 MLLM 推理成本; (ii) 使用多模态相关性来选择最终的示范。我们表明,文本表示对于相关性传播更有效,而视觉和文本模式对于高质量的演示选择至关重要。对八个多模态基准的实验表明,MAG 在标签稀缺的情况下始终优于强大的基线,在有限的伪标签预算下实现了显着的收益。