论文
一个模型,许多图:使用视觉语言模型学习跨异构模态的属性图
One Model, Many Graphs: Learning over Attributed Graphs across Heterogeneous Modalities with Vision-Language Models
摘要
视觉语言模型(VLM)为文本和视觉信息提供了统一的表示空间,但它们作为图结构数据的通用主干的潜力在很大程度上尚未被开发。在实践中,属性图表现出显着的模态异质性:一些图仅包含文本节点属性,其他图仅包含视觉属性,而还有一些图同时提供两者。现有的图学习方法通常是为固定模态模式设计的,需要针对不同设置的单独模型,并限制可扩展性和跨图泛化。为了弥补这一差距,我们提出了 OMG-VLM(一个模型,带有视觉语言模型的多个图),这是一个用于跨异构模态模式学习属性图的统一框架。 OMG-VLM 利用预训练的 VLM 作为共享主干,并引入结构感知图形适配器,该适配器集成邻域信息,同时保持与 VLM 的本机嵌入空间兼容。这种设计可以在单个模型中有效地学习文本属性、图像属性和多模态属性图。跨不同领域的广泛实验表明,OMG-VLM 在节点分类和链接预测等属性图学习任务上始终优于基于 GNN 和 LLM 的最先进基线,同时对未见过的图和不同的模态模式表现出强大的泛化能力。源代码可在 https://github.com/Jo-eyang/OMG-VLM 获取。