论文
VIPER:专家策划的兽医病理学视觉语言模型基准
VIPER: An Expert-Curated Benchmark for Vision-Language Models in Veterinary Pathology
摘要
病理学视觉语言模型正在迅速发展,但现有的基准仍然集中在人体组织,特别是肿瘤学上,而非人类病理学在很大程度上没有得到解决。这一差距在毒理学病理学中尤其重要,实验动物的显微组织检查是临床前药物安全性评估的核心组成部分。为了解决这个问题,我们推出了 VIPER,这是第一个由专家策划的毒理学病理学视觉语言模型评估基准。 VIPER 包含 1,251 个问题,与 7 个器官系统的 419 个 H&E 染色的大鼠组织学图像相关,涵盖多项选择、KPrim 和自由文本格式。所有问题均由委员会认证的兽医病理学家策划和验证。我们总共对 16 个模型进行了基准测试,包括两个新引入的兽医病理学模型、七个人类病理学专用模型和七个通用前沿模型。结果确定了兽医和人类病理学之间存在巨大的领域差距,暴露了前沿模型中正常组织过度诊断的风险,并表明特定领域的训练对于基于视觉的预测仍然至关重要。 VIPER 数据和评估代码可在 https://github.com/mahmoodlab/viper 获取。