论文
解释、验证和对齐视觉语言模型嵌入中的语义层次结构
Explaining, Verifying, and Aligning Semantic Hierarchies in Vision-Language Model Embeddings
摘要
CLIP 等视觉语言模型 (VLM) 编码器可在共享图像文本嵌入空间中实现强大的检索和零样本分类,但很少检查该空间的语义组织。我们提出了一个事后框架来解释、验证和调整 VLM 在给定子类集上引发的语义层次结构。首先,我们通过类质心的凝聚聚类来提取二元层次结构,并通过基于字典的匹配到概念库来命名内部节点。其次,我们通过使用有效的树级和边缘级一致性度量将提取的树与人类本体进行比较来量化合理性,并通过可解释的分层树遍历推理和不确定性提前停止(UAES)来评估效用。第三,我们提出了一种本体引导的事后对齐方法,该方法学习轻量级嵌入空间变换,使用 UMAP 从所需的层次结构生成目标邻域。在 13 个预训练的 VLM 和 4 个图像数据集中,我们的方法发现了系统模态差异:图像编码器更具辨别力,而文本编码器则产生更符合人类分类法的层次结构。总体而言,结果揭示了零样本准确性和本体合理性之间的持续权衡,并提出了改善共享嵌入空间中语义对齐的实用途径。