论文

异构基础模型的几何保持无监督对齐

Geometry-Preserving Unsupervised Alignment for Heterogeneous Foundation Models

应用与实践视觉感知与空间理解

摘要

基础模型推动了计算机视觉领域的快速进步,但视觉语言基础模型(VLM)和纯视觉基础模型(VFM)这两种主要范式仍然仅部分兼容。 VLM 提供基于语言的语义对齐,但通常在视觉上很粗糙,而 VFM 学习有区别的感知几何,但缺乏语义基础。我们提出了 GPUA(几何保留无监督对齐),这是一个集成了 VFM 和 VLM 互补优势的框架。受跨语言对齐的启发,GPUA 将 VFM 特征视为视觉语言,并学习正交映射,将 VFM 空间转换为 VLM 语义空间,保留几何结构并缩小模态差距,而无需标签或模型参数更新。 GPUA 与任务无关,仅需要对预训练模型进行功能级访问。跨不同基准的实验表明,跨模型兼容性得到了改善,并且在下游零样本识别和分割方面取得了巨大的进步,而开销可以忽略不计。代码可在 https://github.com/Yuteam14/GPUA 获取