论文

即插即用的类感知知识注入,通过视觉语言模型进行快速学习

Plug-and-play Class-aware Knowledge Injection for Prompt Learning with Visual-Language Model

模型训练参数高效训练

摘要

即时学习已成为一种有效且广泛使用的技术,可增强视觉语言模型(VLM),例如用于各种下游任务的 CLIP,特别是在特定领域内的零样本分类中。现有方法通常侧重于学习给定域的类共享提示或通过条件提示学习生成特定于实例的提示。虽然这些方法取得了可喜的性能,但它们经常忽略提示设计中特定于类别的知识,从而导致次优结果。根本原因是:1)与粗略的类共享提示相比,特定于类的提示提供了更细粒度的监督,这有助于防止将不同类的数据错误分类到单个类中; 2)与特定于类的提示相比,特定于实例的提示忽略了跨多个实例的更丰富的类级别信息,可能导致同一类的数据被分为多个类。为了有效地将特定于类的知识补充到现有方法中,我们提出了一种即插即用的类感知知识注入(CAKI)框架。 CAKI 包含两个关键组件,即类特定提示生成和查询键提示匹配。前者将特定于类别的知识编码为属于同一类别的少数样本的提示,并将学习到的提示存储在类别级知识库中。后者为每个测试实例提供即插即用机制,以从知识库中检索相关的类级知识并注入这些知识来完善模型预测。大量的实验表明,我们的 CAKI 有效地提高了现有方法在基础类和新类上的性能。代码可在 \href{https://github.com/yjh576/CAKI}{this https URL} 公开获取。