论文

CheXpercept:评估胸部 X 射线专家级病变感知的基准

CheXpercept: A Benchmark for Evaluating Expert-Level Lesion Perception in Chest X-rays

模型评测基准与评测资源

摘要

用于胸部 X 光 (CXR) 分析的视觉语言模型 (VLM) 的评估很大程度上仅限于没有视觉定位的疾病存在分类。此类评估无法验证确保 VLM 临床可靠性所需的专家级病变感知。为了解决这些限制,我们引入了 CheXpercept,这是一个顺序的、多级感知基准,它反映了放射科医生在粗级检测、精细级轮廓评估和修订以及语义级属性提取方面的认知工作流程。为了确保大规模的临床保真度,我们使用半自动生成流程并结合六位医学专家的审查来构建数据集。 CheXpercept 包含源自 2,100 个 CXR 的 10,400 个 QA 项目,涵盖七种临床关键的肺部和心脏病变。为了展示 VLM 感知的当前状况,我们在 CheXpercept 上对 14 个通用和医学 VLM 进行了基准测试。这些模型仅在粗略水平上实现足够的性能,而在更深层次的视觉任务上精度急剧下降。值得注意的是,与一般领域的对应物相比,医学 VLM 几乎没有表现出任何感知优势,这凸显了当前领域适应的系统性缺陷。代码和数据集将公开。