论文

MedVIGIL:在破碎的视觉证据下评估值得信赖的医学 VLM

MedVIGIL: Evaluating Trustworthy Medical VLMs Under Broken Visual Evidence

模型评测基准与评测资源

摘要

医学视觉语言模型 (VLM) 通常在完整的图像问题对上进行评估,但值得信赖的临床使用需要更强的属性:模型必须识别答案的证据基础何时失败。我们通过在受到干扰的证据下的无声失败来研究这一点,其中需要视觉的医学问题与错误的前提、措辞干扰、仅知识重写或投资回报率损坏的图像配对,但模型返回了流畅的非拒绝答案。我们推出了 medvigil,这是一个来自四个公共医疗 VQA 来源的 300 例评估套件,由四位经过委员会认证的放射科医生进行端到端监督:每个黄金答案、拒绝选项、候选答案集、释义、错误前提陷阱、ROI 框和临床风险等级均由临床医生编写。两名主治放射科医生并行注释每个病例,一名高级放射科医生合并发布的清单,另一名独立于施工的第四放射科医生回答每个探头,以提供人类参考基线。该版本包含 2556 个 MCQ 探针、240 个反事实三元组、医生裁定的风险等级和责任标记、ROI 框以及一对开放式变体。我们报告了七个以正确性为条件的审核指标,这些指标汇总为 medvigil 综合评分 (MCS),并审核了 16 个具有视觉功能的模型以及两个纯文本基线。独立放射科医生的 MCS 评分为 83.3,无声故障率为 5.8%,比最强的审计模型(Claude Opus 4.7,69.2)高出 14.1 分的综合净空。基准和评估工具已公开发布。