论文
Hyper3-CLIP:层次条件双曲视觉语言训练
Hyper3-CLIP: Hierarchy-Conditioned Hyperbolic Vision-Language Training
摘要
用对比目标训练的类似 CLIP 的视觉语言模型 (VLM) 可以学习强大的全局图像文本表示,但它们的欧几里德嵌入和全局池化无法编码关系结构,例如部分整体和父子关系。双曲 VLM 通过基于蕴涵的目标解决了这一差距,文本条件变体通过句子和短语级查询改进了细粒度对齐。然而,这两条工作线仍然是分开的:双曲 VLM 使用静态图像和区域特征,而查询条件方法缺乏层次几何结构。我们提出了 Hyper3-CLIP,一种层次条件双曲线 VLM,它将全局、局部和全局-局部对比学习与查询条件视觉池相结合。为了训练模型,我们从文本构建轻量级查询层次结构,包括完整的标题、句子片段、本地化部分描述和提取的短语。每个查询都以视觉块的池化为条件,生成的表示支持图像文本、整体部分和父子蕴涵损失。查询条件池仅在训练期间有效。 Hyper3-CLIP 改进了 COCO 和 Flickr 上的 R@5 和 R@10 检索,以及 VOC 和 COCO 上的多标签分类,同时在层次结构指标上保持竞争力。我们还审核了固定提示机制下的零样本提示灵敏度,并研究了训练期间使用的本地化 GRIT 部分预算的效果。代码可在 https://github.com/Hyper3Labs/hyper3-clip 获取。