论文
双曲视觉语言模型的分层提示学习
Hierarchical Prompt Learning for Hyperbolic Vision-Language Models
摘要
双曲视觉语言模型(VLM)以自然适合层次结构的几何图形表示图像和文本特征,但它们对下游任务的适应在很大程度上依赖于固定提示。与此同时,现有的即时学习方法将类标签视为一个平面集合,并且没有利用可用的分类结构。我们通过针对冻结双曲线 VLM 的分层提示学习插件来解决这一差距。给定固定的离线父类层次结构,它通过单独的父提示学习器、父级监督、双曲蕴涵正则化和父反馈 logit 融合来增强类提示学习器。我们用 CoOp、CoCoOp 和 MaPLe 实例化该方法,产生 HyPLO、CoHyPLO 和 MaHyPLO。在标准的 11 个数据集基准测试中,所有变体都改进了从基础到新的泛化和跨数据集迁移,并且在域转换下与它们的即时学习基线保持可比性。六个层次指标和嵌入分析表明,该方法产生了分类学上更加一致的预测,并在双曲空间中引入了父代、类和图像嵌入的层次结构一致的组织。当必须将新类别放置在固定分类法中时,其收益最大;而对于兄弟类别之间的细粒度混淆或仅影响图像分布的变化,其收益最小。