论文
爱我,爱我的标签:重新思考标签在视觉情境学习即时检索中的作用
Love Me, Love My Label: Rethinking the Role of Labels in Prompt Retrieval for Visual In-Context Learning
摘要
视觉上下文学习 (VICL) 使视觉基础模型能够通过示范性提示来引导它们来处理多项任务。此类提示的选择在很大程度上影响 VICL 性能,是一项关键挑战。先前的工作在即时检索和重新排序策略方面取得了实质性进展,但主要集中在即时图像而忽略了标签。我们发现这些方法有时会得到视觉上相似但标签不一致的提示,这可能会降低 VICL 性能。另一方面,查询和提示之间的标签一致性越高,表明 VICL 结果越强。受这些发现的启发,我们开发了一个名为 LaPR(标签感知提示检索)的框架,它强调了标签在提示选择中的作用。我们的框架首先设计一个图像标签联合表示,以提示明确地合并标签提示。此外,为了在测试时处理不可用的查询标签,我们向具有查询自适应路由的双编码器引入了专家混合机制。每个专家都应该捕获特定的标签模式,而路由器则推断查询自适应混合权重并帮助学习标签感知表示。我们为专家和路由器精心设计了替代优化,分别具有 VICL 性能引导对比损失和标签引导对比损失。大量实验表明 LaPR 在上下文分割、检测和着色任务方面有希望且持续的改进。此外,LaPR 在特征提取器和交叉折叠场景中具有良好的泛化能力,这表明标签利用在 VICL 快速检索中的重要性。代码可在 https://github.com/luotc-why/CVPR26-LaPR 获取。