论文
Ask4VG:在医疗 VQA 中减少先验驱动答案的风险意识问题选择
Ask4VG: Risk-Aware Question Selection for Reducing Prior-Driven Answers in Medical VQA
摘要
医学视觉问答要求模型将其反应建立在图像证据的基础上,因为视觉上不受支持的答案可能会误导下游的解释。然而,许多医学 VQA 问题都是通用的、类似模板的或形式上高度相似的,这可能会鼓励模型学习问答捷径,而不是依赖图像的推理,从而增加出现幻觉反应的风险。我们提出了 Ask4VG,一个用于风险意识问题选择的无标签试点框架。 Ask4VG通过反事实视觉探测来估计问题引起的幻觉风险:在原始图像、扰动图像、空白图像和不匹配图像下提出相同的问题,并将得到的答案关系转换为反事实风险估计器的弱监督。然后,学习的估计器对候选问题重写进行重新排序,以支持保留意图的问题,这些问题在最终答案生成之前对丢失或不匹配的视觉证据的稳定性较小。在使用 Qwen2-VL-2B-Instruct 的 VQA-RAD 上,仅提示重写会增加反事实风险,而预测风险重新排序将保留风险从 0.658 降低到 0.623,并将精确度从 0.337 提高到 0.356。 300 个样本的 PMC-VQA 外部检查显示出相同的风险降低方向,但准确性略有提高。这些结果表明,问题选择是对可靠的医疗 VQA 的响应级幻觉缓解的有希望的补充。