论文
SmoGVLM:小型图形增强视觉语言模型
SmoGVLM: A Small, Graph-enhanced Vision-Language Model
摘要
大型视觉语言模型(VLM)在多模态任务上表现出色,但经常出现幻觉,并且在知识密集型推理方面基础较差。我们提出了 SmoGVLM,这是一种小型的图增强型 VLM,它使用图神经网络将结构化知识与视觉和文本模式集成在一起。我们研究了我们的方法在一系列模型大小(从小型 (1.3B) 到大型 (13B) 模型)中的效果。我们的结果表明,当使用我们的方法进行训练时,小型模型可以实现高达 16.24% 的性能提升,并超越较大的模型,优于较大的 VLM 和强大的微调基线。这些结果凸显了结构化知识增强对于高效、小规模多模态推理系统的潜力。