论文
用医学分类体系测量并对齐视觉语言模型中的抽象
Measuring and Aligning Abstraction in Vision-Language Models with Medical Taxonomies
摘要
视觉语言模型在胸部X光分类上展现强零样本性能,但标准的扁平指标无法区分临床上轻微与严重的错误。本工作研究如何利用医学分类体系量化并缓解抽象错误。我们使用层级指标对多个最先进 VLM 进行基准测试,并引入灾难性抽象错误以捕捉跨分支错误。我们的结果显示,尽管扁平性能很高,VLM 与临床分类体系存在显著错位。为此,我们提出风险约束阈值化与采用径向嵌入的分类感知微调,把严重抽象错误降至 2% 以下,同时保持有竞争力的性能。这些发现凸显层级评估与表征层面对齐对于更安全、更有临床意义的 VLM 部署的重要性。
