论文

学习选择视觉上下文演示

Learning to Select Visual In-Context Demonstrations

上下文与知识上下文工程

摘要

多模态 大语言模型 (MLLM) 通过上下文学习 (ICL) 适应视觉任务,这在很大程度上依赖于演示质量。主要的演示选择策略是无监督 k 最近邻 (kNN) 搜索。虽然简单,但这种相似性优先的方法对于复杂的事实回归任务来说并不是最佳选择。它选择无法捕获任务完整输出范围的冗余示例。我们将选择重新定义为一个顺序决策问题,并引入学习选择演示(LSD),训练强化学习代理来构建最佳演示集。使用 Dueling DQN 和以查询为中心的 Transformer 解码器,我们的代理可以学习最大化 MLLM 下游性能的策略。通过对五个视觉回归基准进行评估,我们发现了一个关键的二分法:虽然 kNN 对于主观偏好任务仍然是最佳的,但 LSD 在客观、事实回归任务上显着优于基线。通过平衡视觉相关性和多样性,LSD 更好地定义了回归边界,阐明了何时学习选择对于视觉 ICL 是严格必要的。