论文

多模态 LLM 的置信度校准:通过医学 VQA 进行的实证研究

Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA

模型评测鲁棒性、公平性与可信度评测

摘要

多模态 大语言模型 (MLLM) 在医疗任务中显示出巨大潜力,但其引发的置信度往往与实际准确性不一致,可能导致误诊或忽视正确的建议。本研究首次对医学 MLLM 的准确性和置信度之间的关系进行了全面分析。它提出了一种将基于多策略融合的询问(MS-FBI)与辅助专家LLM评估相结合的新方法,旨在提高医学视觉问答(VQA)中的置信度校准。实验表明,我们的方法在三个医学 VQA 数据集中将预期校准误差 (ECE) 平均降低了 40%,显着增强了 MLLM 的可靠性。研究结果强调了医疗保健中 MLLM 领域特定校准的重要性,为人工智能辅助诊断提供了更值得信赖的解决方案。