论文
CI-JEPA:自监督学习联合嵌入预测架构中潜在表示的反事实分析
CI-JEPA: A Counterfactual Analysis of Latent Representations in Joint-Embedding Predictive Architectures for Self-Supervised Learning
摘要
自监督视觉表示学习在表示训练期间无需手动注释即可学习有用的特征。基于图像的联合嵌入预测架构(I-JEPA)可预测屏蔽图像区域的潜在表示,但其目标并未明确模拟对指定视觉干预的响应。我们引入了 CI-JEPA,这是一种反事实干预感知扩展,可以学习预测原始图像和修改后的对应图像之间的表示变化 $ΔZ = Z_{\mathrm{CF}} - Z$。我们通过选择性敏感性来评估表示的稳健性:对与任务相关的语义变化的反应比对令人讨厌的变化的反应更强。 Flowers102 上的实验使用花中心遮挡作为候选语义干预,使用背景模糊和色调作为候选干扰干预。通过冻结编码器线性探测,CI-JEPA 实现了 78.14% 的最佳验证精度,而预训练的 ViT-B/16 和 I-JEPA 基线的验证精度为 77.55%,提高了 0.59 个百分点。报告的平均 $L_2$ 表示变化对于中心遮挡为 4.42,对于背景色调为 3.48,对于背景模糊为 2.83。这种排序与所评估的干预措施的相对语义选择性一致,而不是完全的滋扰不变性。准确性比较是互补的,并且并未建立相对于基线的改进的鲁棒性。这些受控图像修改为研究干预引起的 JEPA 表示变化提供了一个框架;他们没有建立因果特征发现或对所有视觉变化的鲁棒性。
