论文

EVADE:经过证据验证的代理诊断与逃脱

EVADE: Evidence-Verified Agentic Diagnosis with Escape

模型推理推理验证与自校正

摘要

医学视觉语言模型(VLM)可以实现高精度,但仍然不可靠:它们系统性地过度自信,从测试时推理中获益甚少,并且缺乏可靠地校准对自己反应的信任的能力。我们引入了 EVADE(证据验证代理诊断与逃逸),这是一种推理、非训练方法,可增强部署单个冻结 VLM 的安全性。 EVADE 做出响应,并且在不确定时定位与诊断最相关的区域,在缩放视图上重新回答,并且仅当整个图像和缩放视图响应一致时才提交;否则,它弃权。为了直接解决单模型自检中的验证幻觉,我们的主要想法是验证不同图像视图之间的门一致性,而不是重新读取模型自己的文本。使用 Qwen2.5-VL-7B 对 VQA-RAD、SLAKE 和 PathVQA 进行的实验评估表明,EVADE 是唯一能够在保持精度的同时改善校准和选择性风险的方法,与零样本相比,预期校准误差 (ECE) 减少高达 45%。思想链、自我一致性和自我验证都至少在一个轴上失败了。基础分析报告称,自我提出的区域在诊断结构定位方面比中心或随机作物表现更好。但是,7B VLM 无法使用此本地化来修改答案。因此,可靠性增益来自一致性门和校准弃权。