论文
MedFG-VQA:轻量级医学 VQA 的低频记忆和图形注意力
MedFG-VQA: Low-Frequency Memory and Graph Attention for Lightweight Medical VQA
摘要
医学视觉问答 (Med-VQA) 为临床决策支持带来了巨大的希望,但由于注释数据有限和现有大型视觉语言模型的高计算需求而面临挑战。我们提出了 MedFG-VQA,这是一种轻量级框架,它利用内存库来增强基于 DCT 的低频特征,并采用图增强的交叉注意力来实现有效的视觉文本对齐。具体来说,我们的方法具有两个关键组成部分:频率记忆融合(FMF)和图形感知交叉注意(GACA),前者通过从基于 DCT 分解的可学习记忆库中检索来增强低频特征,后者通过交叉注意对齐视觉文本特征,并通过图卷积聚合对其进行细化。为了解决数据稀缺问题,我们构建了 SynMed-VQA,这是一个大规模合成数据集,包含使用 GPT-4o 生成的 9 种成像模式和 10 个主要器官的超过 200 万个问答对。对 SynMed-VQA 和其他三个标准生物医学 VQA 基准的大量实验表明,与更大的模型相比,MedFG-VQA 实现了具有竞争力或优越的性能,同时保持了显着较低的计算成本,凸显了其效率和临床部署潜力。