论文
CARE:可靠的医疗 VQA 的置信感知推理
CARE: Confidence-Aware Reasoning for Reliable Medical VQA
摘要
强化 微调 (RFT) 使医疗多模态 大语言模型 (MLLM) 能够为视觉问答产生思维链 (CoT) 推理,但这些模型遭受 $\textit{置信度错误校准}$——表达的确定性与实际诊断准确性之间的系统性差距,从而破坏了临床信任。我们提出$\textbf{CARE}$,一个$\textbf{C}$onfidence-$\textbf{A}$ware医疗$\textbf{RE}$asoning框架,通过双级管道联合优化准确性和校准。首先,可扩展的 Medical-CoT 综合为受监督的 微调 提供结构化冷启动数据。其次,具有新颖的$\textbf{置信感知奖励(CAR)}$机制的组相对策略优化(GRPO)将模型的置信度与奖励信号内的诊断正确性联系起来。在三个医疗 VQA 基准中,$\textbf{CARE}$ 实现了最高的诊断准确性,同时获得最低的预期校准误差和幻觉率,为值得信赖的临床决策支持奠定了基础。我们的代码可在 https://github.com/anotherbricki/CARE 获取。