论文

PathLang:计算病理学中视觉语言模型的以语言为中心的基准

PathLang: A Language-Centered Benchmark for Vision-Language Models in Computational Pathology

模型评测基准与评测资源鲁棒性、公平性与可信度评测

摘要

病理视觉语言模型(VLM)显示出强大的视觉感知能力,但其在语言领域的鲁棒性仍然较差。现有的病理学 VLM 基准在很大程度上依赖于规范的封闭集提示或仅扰乱通用模板,将语言视为固定的评估组件而不是模型行为的可变轴。然而,在临床实践中,诊断语言因报告、机构和候选诊断而异。我们推出 PathLang,一个以语言为中心、以临床为基础的零样本基准测试。 PathLang 固定基础幻灯片、真实标签和图像文本评估方向,同时仅系统地改变诊断语言,因此性能差异反映了诊断的措辞方式,而不是图像的内容。语言变化遵循病理学家实际重新表述诊断的方式(术语、特异性和报告风格),所有提示和候选库均由六名委员会认证的病理学家验证。 PathLang 涵盖四个任务系列:(1)零样本 使用图像文本对齐分析进行分类,(2)跨模态检索,(3)释义鲁棒性,包括语义等价释义、长度和报告风格变化以及提示集成,以及(4)在四个具有不同形式语义竞争的候选池上进行开放词汇诊断检索。在跨越四个器官的九个 VLM 和五个公共数据集中,我们发现性能对临床等效释义高度敏感,在不同形式的语义竞争中差异很大,并且图像文本对齐质量不一定转化为类间可分离性。我们在 https://anonymous.4open.science/r/PathLang. 发布了提示语料库、候选池、预先计算的文本嵌入和评估代码