论文
审核可信赖的医疗 VQA 的前沿视觉语言模型:基础失败、格式崩溃和领域适应
Auditing Frontier Vision-Language Models for Trustworthy Medical VQA: Grounding Failures, Format Collapse, and Domain Adaptation
摘要
在临床环境中部署视觉语言模型 (VLM) 需要在实际故障条件下具有可审核的行为,但前沿 VLM 在专业医疗输入上的故障情况却很少被描述。我们沿着两个与信任相关的轴在医疗 VQA 上审核了五个最新的前沿和基础意识 VLM(Gemini~2.5~Pro、GPT-5、o3、GLM-4.5V、Qwen~2.5~VL)。感知:所有模型对解剖和病理目标的定位都很差——最好的模型仅达到 0.23 平均 IoU 和 19.1% Acc@0.5——并且表现出临床上危险的偏侧性混乱。管道集成:自接地管道,其中相同的模型本地化然后回答,降低了每个模型的 VQA 准确性 - 由两步提示下不准确的本地化和格式合规性失败驱动(VQA-RAD 上的 Gemini 和 GPT-5 的解析失败上升到 70%--99%)。用真实注释替换预测框可以恢复并提高 VQA 准确性,这与感知模块而不是分解本身的故障一致。这些观察结果表明,接地质量是我们 SLAKE 边界框设置中的主要可信度瓶颈。作为补充的微调后续,在组合 Med-VQA 训练数据上对 Qwen~2.5~VL 进行监督微调,在同类方法中达到了报道的最高 SLAKE 开放式召回率 (85.5%),这表明 VQA 级别的差距可以通过领域适应来解决;这是否也能消除感知/可信度瓶颈,留待未来的工作。
