论文

利用多语言 CLIP 实现语言条件视觉目标定位

Language-Conditioned Visual Grounding with CLIP Multilingual

模型评测模型行为与机制分析

摘要

多语言视觉-语言模型表现出跨语言的系统性能差距,但其机制仍然不明确:跨语言分歧可能源于视觉编码器、文本分支或它们的交互。我们通过密集的多语言 CLIP 探针解决了这种歧义,其中视觉编码器在 13 种不同类型的语言中保持相同,只有 XLM-RoBERTa 文本分支有所不同。我们在 11 个概念和 210 个图像上评估了跨越 7 倍视觉编码器尺度差距的两个 CLIP 架构(XLM-R base + ViT-B/32,~87M 视觉参数;XLM-R large + ViT-H/14,~632M),并通过 cluster-mask IoU、top-percentile IoU 和 Spearman 排名相关性与英语参考文献(n=2,310)量化跨语言一致性每种语言的配对观察)。出现了三个发现。首先,低资源语言(阿拉伯语、巴斯克语、卢森堡语)在两个主干尺度上都会产生结构性惩罚(Wilcoxon HR>LR p<10^-300;簇掩码 IoU 间隙在基础上 +0.114,在整体上 +0.143),将赤字隔离到文本分支。其次,将编码器缩放 7 倍扩大了结构性故障案例的差距(巴斯克语 Δ=-0.056,卢森堡语 Δ=-0.076),同时改进了阿拉伯语(Δ=+0.033),将语料库覆盖率与分词器词元膨胀率故障分开。第三,跨语言保留了峰值相似性(大规模时平均比率为 0.94),而簇掩模 IoU 急剧下降,将空间错位(而不是信号崩溃)视为主要的故障模式。每 1,000 个查询的功耗为 3.4-3.9 Wh,密集 CLIP 视觉目标定位与高吞吐量推理预算相比具有竞争力,将其定位为能源感知多语言部署的实用基础。