论文
SeVer:3D 医学图像问答的选择性视觉曝光和检索
SeVeR: Selective Visual Exposure and Retrieval for 3D Medical Image Question Answering
摘要
体积医学 VQA 需要对长而冗余的 3D 视觉标记序列进行推理,特别是在多序列 MRI 中,其中互补模式提供了不同的诊断线索,但使解码器暴露于许多重复的解剖区域。为了研究多序列视觉冗余下的推理,我们首先引入 BreMRIs-VQA,这是一种临床策划的乳腺 MRI 基准,具有来自 71.0K 序列和 12.9K 患者的 119M QA 对,涵盖自由文本和多项选择问题。我们进一步提出了 SeVeR,一种选择性视觉暴露框架,它将密集的体积压缩成模态原型,并在解码过程中通过变化感知的门控注意力检索互补的多级证据,并以边际效用自我一致性目标进行训练,抑制无用的检索。 BreMRIs-VQA 和公共基准测试的实验表明,SeVeR 提高了判别性能和生成性能,同时暴露的视觉标记显着减少。