论文

JEPA 预测器:用于完成遮挡特征的可转移算子

The JEPA Predictor: A Transferable Operator for Occluded Feature Completion

模型评测模型行为与机制分析

摘要

联合嵌入预测架构 (JEPA) 与其编码器联合训练预测器,但下游部署会丢弃预测器并单独从编码器读取特征。通过构造,预测器是从可见上下文特征到屏蔽位置处的特征的学习算子,这是部分视图分类器所需的结构。我们证明该运算符可以跨编码器系列移植。我们首先确定,在重掩模条件下,在 JEPA 编码器上保留冻结预测器可以大大缩小与最强的非 JEPA 判别基线之间的准确度差距。然后,我们通过特征空间之间的单个线性投影将 I-JEPA 和 V-JEPA 2 的冻结预测器连接到四个非 JEPA 主机(CLIP、DINOv3、DINOv2、MAE)上,以封闭形式拟合 500 个 ImageNet-1k 图像。在 ImageNet-9 和斯坦福狗中以及在三个掩模分数中,每个主机的掩模编码器基线的提升随着每个主机-捐赠者对中的掩模分数 K 单调增长。 CLIP 与 I-JEPA 预测器配合使用,可以恢复 ImageNet-9 上严重遮挡时掩蔽所消除的大部分准确度,并将细粒度斯坦福狗从 15.9% 提升到 52.1%(+36 pp)。该机制是可识别的:投影在可见斑块上支付固定成本,而预测器在遮蔽斑块上提供不断增长的收益;其益处在重度闭塞机制中占主导地位。在细粒度分类的低 K 下,投影成本超过收益,从而定义了线性桥损坏的边界。冻结的 JEPA 预测器充当便携式算子,用于跨编码器系列完成遮挡特征,无需重新训练任一模型,同时为每个掩模分数拟合匹配的线性探针。