论文

3vKCCA:VLM视觉表征增强的核典型相关视角

Revisiting Visual Representation Enhancement of VLMs via Kernel Canonical Correlation Analysis

应用与实践视觉感知与空间理解

摘要

CLIP等视觉-语言模型具有强语义泛化但细粒度视觉感知有限。近期KUEA给出自然补救:在视觉中心DINOv2监督下微调图像编码器以逐元素对齐其核矩阵,同时正则化嵌入接近预训练视觉编码器以保持CLIP图文语义。但我们发现削弱DINOv2对齐损失的角色不一定降低细粒度视觉性能,提示核矩阵差异可能不足以支撑进一步的视觉表征增强。本文以核典型相关分析(KCCA)的新视角刻画特征子空间上的表征对齐——最大化投影相关性;优化上基于KKT条件导出高效的端到端训练方案,避免KCCA的特征值问题。我们进一步把方法扩展为三视角形式(3vKCCA),在统一优化框架中纳入预训练文本编码器的投影做联合对齐。CLIP ViT-L/14在ImageNet-1K上,3vKCCA把MMVP-VLM准确率从17.8提升到25.9,大幅超越现有方法,同时保持零样本图文检索性能。