论文

用于医学视觉问答的频域双分支融合

Frequency-Domain Dual-Branch Fusion for Medical Visual Question Answering

应用与实践行业应用

摘要

医学视觉问答 (VQA) 需要将微妙的视觉证据(包括病变纹理、边界清晰度和弥散密度变化)与临床语言保持一致。在空间域中运行的现有多模态融合方法可能无法充分利用视觉和文本表示中存在的互补频率信息。我们引入了一个双分支频域融合模块,该模块对输入问题进行频谱滤波,从而在重建用于生成答案的空间表示之前能够自适应选择全局低频结构和细粒度高频细节。为了提供更丰富的过滤频谱,我们从冻结 BiomedCLIP 编码器的早期纹理敏感层和最终语义层中提取互补特征,并在与 BioBART 解码器进行分阶段联合训练之前使用对称 InfoNCE 目标将两者与问题表示对齐。我们在 PMC-VQA 上对所提出的模型进行预训练,并在 VQA-RAD 和 SLAKE 基准上对其进行微调,证明频率感知多模态融合可以提高医疗 VQA 性能,同时保持轻量级高效的架构。