论文

用于自动病理诊断和报告生成的视觉语言模型基准测试

Benchmarking Vision-Language Models for Automated Pathology Diagnosis and Report Generation

模型评测基准与评测资源

摘要

视觉语言模型(VLM)的快速发展加速了计算病理学的进步;然而,基于全幻灯片图像 (WSI) 的病理报告生成仍然受到大规模 WSI 报告数据集的稀缺性以及将空间分布的视觉模式映射到结构化临床文本的复杂性的限制。为了解决这个问题,我们引入了临床策划的泛亚洲 WSI 报告数据集,其中包含来自五个机构的约 10,500 对数据集,并通过 MICCAI 挑战建立了 REG 2025 基准,以对多模式模型进行系统评估。我们分析了提交的方法,涵盖预训练的 VLM、多实例学习框架、分层专家模型、检索增强生成和跨模式 Transformer。结果并没有表明单独使用 VLM 就足以获得卓越的性能,而是表明性能最佳的方法受益于结构化报告表示、分层诊断分解和有效的多模态基础。我们确定了关键的局限性,包括定量属性估计的不稳定性(例如数字幻觉)和诊断过度规范的趋势,其中一些错误类似于常规病理学中已知的诊断陷阱。这些发现将 REG 2025 确立为评估计算病理学中基于 WSI 的结构化报告生成和视觉语言理解的基准,为临床基础多模态病理模型的设计提供见解。