论文

用医学分类体系测量并对齐视觉语言模型中的抽象

Measuring and Aligning Abstraction in Vision-Language Models with Medical Taxonomies

模型评测评测方法与指标

摘要

视觉语言模型在胸部X光分类上展现强零样本性能,但标准的扁平指标无法区分临床上轻微与严重的错误。本工作研究如何利用医学分类体系量化并缓解抽象错误。我们使用层级指标对多个最先进 VLM 进行基准测试,并引入灾难性抽象错误以捕捉跨分支错误。我们的结果显示,尽管扁平性能很高,VLM 与临床分类体系存在显著错位。为此,我们提出风险约束阈值化与采用径向嵌入的分类感知微调,把严重抽象错误降至 2% 以下,同时保持有竞争力的性能。这些发现凸显层级评估与表征层面对齐对于更安全、更有临床意义的 VLM 部署的重要性。

用医学分类体系测量并对齐视觉语言模型中的抽象
图1:灾难性抽象错误(CAE)示意图。一张 ground truth 标签为 fracture(FN,蓝色)的胸部 X 光片被错误分类为 nodule(FP,橙色)。由于预测与 ground truth 位于医学分类体系(上方)中不相交的分支,这种跨分支错误构成一次 CAE。