论文
你有多确定?改进医学 VQA 中的语言不确定度校准
Just how sure are you? Improving Verbalized Uncertainty Calibration in Medical VQA
摘要
应用于医学视觉问答 (VQA) 的多模态 大语言模型 (MLLM) 往往会产生过度自信的输出,而不管实际的正确性如何,而现有的语言化置信度校准方法主要仅针对文本 LLM 开发,无法考虑医学图像理解的多模态性质。这项工作提出了一种基于训练的框架,该框架使用复合损失函数对 MLLM 进行微调,以改进其校准,该复合损失函数结合了 Brier 型校准项、防止置信度崩溃到极值的锚定正则器、对比图像文本对齐项和基于 KL 的模型稳定项。对齐信号源自 $2 × 2$ 阶乘扰动设计,该设计将图像存在与文本完整性交叉,探索模型对视觉模态输入与语言先验的依赖。最后,使用一个top K KL散度正则化器来保护模型在微调过程中的应答能力。在三个医疗 VQA 基准和两种架构(MedGemma 4B IT 和 Qwen2 VL 7B Instruct)中,我们的方法将校准误差减少了 60% 或更多,并将辨别力提高了 26% 或更多,同时保持了预测准确性。平均而言,该技术优于基于提示、基于采样和基于训练的方法,并且消融实验证实损失函数的每个组成部分对于改进校准确实是必要的。实验的所有代码都是公开的。