论文

ARGENT:自适应分层图像文本表示

ARGENT: Adaptive Hierarchical Image-Text Representations

模型训练预训练

摘要

CLIP 等大规模视觉语言模型 (VLM) 可以学习强大的语义表示,但在欧几里得空间中运行,无法捕获视觉和语言概念的固有层次结构。双曲几何以其指数体积增长,为嵌入这种低失真的层次结构提供了一种原则性的替代方案。然而,现有的双曲 VLM 使用不稳定的蕴涵损失:当父嵌入向原点收缩时,它们的蕴涵锥体向半空间扩大,导致灾难性的锥体崩溃,破坏了预期的层次结构。此外,这些模型的分层评估仍然不可靠,主要是基于检索和基于相关性的指标,并且容易出现分类依赖和模糊的否定。为了解决这些限制,我们提出了一种自适应蕴涵损失与范数正则化器相结合,可以在没有启发式孔径裁剪的情况下防止锥体塌陷。我们进一步介绍了一种基于角度的概率蕴涵协议(PEP),用于评估分层理解,并使用 AUC-ROC 和平均精度进行评分。本文介绍了更强的双曲 VLM 基线 ARGENT,自适应分层图像文本表示。 ARGENT 在图像分类、文本到图像检索和提出的分层度量方面分别将 SOTA 双曲 VLM 提高了 0.7、1.1 和 0.8 个绝对点。