论文

半监督视觉语言学习的拓扑感知表示对齐

Topology-Aware Representation Alignment for Semi-Supervised Vision-Language Learning

模型训练监督微调与指令调优

摘要

视觉语言模型表现出了强大的性能,但它们通常很难推广到专门领域。虽然半监督视觉语言学习通过利用一小组标记的图像文本对和大量未标记的图像来减轻这一限制,但现有方法基本上仍然是成对的,并且无法对多模态表示流形的全局结构进行建模。现有的基于拓扑的对齐方法依赖于持久图匹配,既不能保证几何对齐,也不能利用视觉语言学习的核心图像文本配对信息。我们提出了拓扑感知多模态表示对齐(ToMA),这是一个使用持久同源性来识别拓扑显着边缘并通过可用的跨模态对应将它们跨模态对齐的框架。 ToMA 利用 H_0 死亡边和轻量级 H_1 诞生边,使其能够捕获连通性和循环结构,而无需构造 2-单纯形。实验表明,ToMA 产生了稳定的收益,在遥感方面有明显的改进,在时尚检索方面也有适度但一致的好处。附加分析表明,ToMA 比替代的基于拓扑的目标更稳定,并且轻量级 H_1 出生边缘提供有用的高阶结构信号。