论文

DualRead:分离医学视觉语言模型的能力学习与视觉证据置信度估计

Separating Capability from Confidence: Grounded Dual-State Calibration for GRPO-Trained Medical Vision-Language Models

模型推理推理验证与自校正

摘要

医学视觉语言模型 (VLM) 需要反映答案正确性和患者特定视觉证据的置信度。最近基于 GRPO 的方法优化了语言表达的置信度和答案生成。然而,这种联合优化可能会干扰答案学习并提高对接近二元值的信心。语言化的置信度也没有提供对视觉支持的明确评估。因此,我们将能力学习与置信度估计分开,并提出 \textbf{DualRead}。 DualRead 建立在这样的洞察之上:可以在回答过程的关键时刻从策略模型的内部状态中读取可靠性。它冻结了 GRPO 训练的策略模型,并将答案前的可解决性与生成答案及其视觉支持的答案后评估结合起来。为了进一步评估置信度是否反映了视觉基础,我们引入了 \textbf{Counterfactual Confidence Grounding AUC} (CCG-AUC)。它衡量当真实图像替换将策略模型从正确变为错误时,置信度是否会降低。在两个 VLM 主干以及分布内和分布外的医疗 VQA 基准测试中,DualRead 提高了对语言表达的置信度的正确性辨别和校准,同时保持答案准确性。 CCG-AUC 揭示了信心是否对与答案相关的视觉证据做出反应,而不是主要对非视觉线索做出反应。