论文

医疗 VQA 中的过度自信和校准:经验发现和幻觉感知缓解

Overconfidence and Calibration in Medical VQA: Empirical Findings and Hallucination-Aware Mitigation

模型评测鲁棒性、公平性与可信度评测

摘要

随着视觉语言模型 (VLM) 越来越多地应用于临床决策支持,需要的不仅仅是准确性:知道何时信任其预测也同样重要。然而,在医学领域,对这些模型的过度自信进行全面、系统的调查仍然非常缺乏。我们通过对 VLM 置信度校准进行全面的实证研究来解决这一差距,研究涵盖三个模型系列(Qwen3-VL、InternVL3、LLaVA-NeXT)、三个模型尺度(2B--38B)以及多个置信估计提示策略,跨越三个医学视觉问答(VQA)基准。我们的研究得出了三个关键发现:首先,过度自信在模型家庭中持续存在,并且不能通过扩展或提示来解决,例如思维链和言语信心变体。其次,简单的事后校准方法(例如普拉特缩放)可以减少校准误差并始终优于基于提示的策略。第三,由于其(严格的)单调性,这些事后校准方法在提高预测的判别质量方面本质上受到限制,使 AUROC 处于同一水平。受这些发现的启发,我们研究了幻觉感知校准(HAC),它将基于视觉的幻觉检测信号作为补充输入来完善置信度估计。我们发现,利用这些幻觉信号可以改善校准和 AUROC,在开放式问题上收益最大。对于封闭式问题,特定于格式的信号(例如 logits 边距)显示出更多信息。总体而言,我们的研究结果表明事后校准是医疗 VLM 部署相对于原始置信​​度估计的标准做法,并强调了幻觉信号的实际用途,以便在医疗 VQA 中更可靠地使用 VLM。