论文
DINORANKCLIP:DINOv3 蒸馏 和注入,用于具有高阶排序一致性的视觉语言预训练
DINORANKCLIP: DINOv3 Distillation and Injection for Vision-Language Pretraining with High-Order Ranking Consistency
摘要
对比语言图像预训练(CLIP)存在两个结构性弱点:对称的 InfoNCE 损失丢弃了不匹配的批内对之间的相对顺序,全局池化将视觉表示折叠成对细粒度局部结构不太敏感的语义瓶颈。 RANKCLIP 通过列表方式的 Plackett-Luce 排名一致性损失部分解决了第一个问题,但其模型是严格的一阶模型,并且继承了第二个弱点。我们提出了 DINORANKCLIP,这是一个联合解决这两个问题的预训练框架。我们的主要贡献是通过双分支轻量级学生和具有通道空间注意力的多尺度融合模块、自注意力细化器和冲突感知门(将跨模态对齐保留到一阶),将冻结的 DINOv3 教师注入到对比主干中。作为补充,我们引入了高阶 Plackett-Luce 排序模型,其中每个位置的效用通过注意参数化的成对和元组转换项得到增强;该系列包含 CLIP 和 RANKCLIP 作为嵌套的零阶和一阶特殊情况,并且每个基准上的最佳阶数为 $R^*=3$。完整的实证研究——顺序扫描、五个数据集上的细粒度探测、四节点模态差距分析、六变体融合消融——在单个八 GPU H100 节点上花费 72 小时完成,并完全在 Conceptual Captions 3M 上进行训练。在匹配计算下,DINORANKCLIP 的性能始终优于 CLIP、CyCLIP、ALIP 和 RANKCLIP,在最直接强调局部结构推理的细粒度和分布外评估方面具有最大的相对增益。