论文
用于医学视觉问答的噪声感知视觉表示学习
Noise-Aware Visual Representation Learning for Medical Visual Question Answering
摘要
医学视觉问答 (Med-VQA) 通过使 AI 模型能够解释医学图像并回答临床相关查询,在临床决策支持方面具有强大的潜力。最近的方法通常通过轻量级映射网络将现成的视觉编码器与 大语言模型 (LLM) 连接起来,以降低计算成本。然而,这些方法常常忽视处理噪声和视觉表示中不相关的小变化的重要性。为了应对这些挑战,我们提出了一种噪声感知 Med-VQA 框架,该框架在视觉嵌入映射到 LLM 的输入空间之前结合了去噪自动编码器。去噪自动编码器经过预训练,可以从损坏的输入中重建干净的视觉嵌入,从而鼓励模型学习对噪声不太敏感的鲁棒视觉表示。然后使用多层感知器 (MLP) 将生成的嵌入投影到语言模型嵌入空间中,形成视觉前缀标记,为 LLM 提供图像信息。为了在无需完全重新训练的情况下实现高效自适应,我们采用低秩自适应(LoRA)的参数高效 微调。所提出的方法在 SLAKE 和 PathVQA 基准上进行评估。实验结果表明,提高了对噪声输入嵌入的鲁棒性,同时在多个评估标准中保持有竞争力的清洁性能。这些发现表明,学习更强大的视觉表示可以增强 Med-VQA 的性能和稳健性。