论文

探究 CLIP 对 360 度文本和视觉语义的理解

Probing CLIP's Comprehension of 360-Degree Textual and Visual Semantics

模型评测评测方法与指标

摘要

从文本即时创建丰富的 360 度全景世界的梦想正在迅速成为现实,但我们可靠评估其语义对齐的能力存在重大差距。对比语言图像 预训练 (CLIP) 模型是标准人工智能评估器,主要接受透视图像-文本对的训练,面临着一个关于其对 360 度全景图像-文本对的独特特征的理解的开放性问题。本文通过首先引入两个概念来解决这一差距:\emph{360 度文本语义}(通过显式格式标识符传达的语义信息)和 \emph{360 度视觉语义}(水平循环移位下的不变语义)。为了探究 CLIP 对这些语义的理解,我们提出了使用关键字操作和不同幅度的水平循环移位的新颖评估方法。对流行的 CLIP 配置进行严格的统计分析表明:(1)CLIP 模型有效地利用显式文本标识符,展示了对 360 度文本语义的理解; (2) CLIP 模型无法在水平循环移位下稳健地保持语义对齐,表明对 360 度视觉语义的理解有限。为了解决这个限制,我们提出了一个基于 LoRA 的 微调 框架,该框架明确地向循环移位注入不变性。我们的微调模型表现出对 360 度视觉语义的更好的理解,尽管原始语义评估性能略有下降,突出了将 CLIP 适应 360 度全景图像的基本权衡。代码可在 https://github.com/littlewhitesea/360Semantics 获取。