论文
Med-R2:医学 VLM 中循证推理的对抗性基准
Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs
摘要
视觉语言模型在一般医学视觉问答中表现出了令人印象深刻的能力,但由于可解释性有限,目前尚不清楚它们的预测是否反映了基于证据的临床推理或对虚假先验的依赖。我们引入了 Med-R2 Bench,这是一个与临床工作流程一致的分层基准,用于评估基于视觉基础的对抗稳健性。我们设计逐步的 QA 任务来评估推理链是否严格基于四个临床阶段的视觉证据,并采用对抗性扰动来测试针对误导性线索的稳健性。 Med-R2 包含 42,432 张图像、31 个任务类别和 110,406 个 QA 对。对 14 个 VLM 的评估揭示了四阶段临床工作流程中的连续性能下降。对抗性实验表明,模型在很大程度上依赖于正确的提示来猜测答案。即使提供了明确的视觉提示,模型也很难准确地对齐文本描述。最后,我们使用分层数据演示了逐步 微调 显着提高了推理的稳健性,突显了其推动循证医疗 AI 未来改进的潜力。