论文

Hidden-Shot:针对底层视觉通才模型的单样本任务泛化

Hidden-Shot: Towards One-Shot Task Generalization for Low-Level Vision Generalist Models

模型架构新型架构

摘要

尽管围绕底层视觉通才模型的参与度很高,但它们在学习任务之外的零/少样本场景中的有效性仍未得到验证。培养理想的多面手的主要挑战在于实现从新的看不见的任务中进行概括的能力,这也可以通过匹配的定量标准进行评估。现有方法在即时工程方面取得了一些进展,但尚未系统地探索广泛的底层视觉任务中的这一差距。受该问题的启发,我们提出了 Hidden-Shot,这是一种隐式提示机制,旨在探索视觉通才模型中的底层任务适应。具体来说,该方法提取基于隐式视觉任务的信息,利用全局任务感知文本提示,并有选择地将隐式信息与任务内处理信息合并,以增强新任务中的一次性能力。整体设计以经济有效的方式执行直接注入,同时最小限度地改变原始通用模型的架构。此外,我们引入了一种称为C/U评估的数据驱动评估框架,涵盖两种基本场景,即用于重新训练现有模型的3C4U(3个常规任务和4个非常规任务)和用于从头开始训练的3C7U(3个常规任务和7个非常规任务),作为系统测试底层通才模型泛化能力的综合评估。在七个和十个数据集上进行的实验优于最先进的视觉通才模型,分别通过 3C4U 和 3C7U 框架进行验证。我们提出的Hidden-Shot方法展示了一次性新任务的卓越性能,同时在现有任务上保持一致的性能。