论文

PathReportEval:病理报告生成的系统基准

PathReportEval: A Systematic Benchmark for Pathology Report Generation

模型评测评测方法与指标

摘要

从全幻灯片图像 (WSI) 生成病理报告是一个快速发展的多模式学习问题,但进展很难衡量,因为现有研究使用异构数据集、模型设置、视觉编码器和评估协议。此外,常用的自然语言生成指标(包括 BLEU、ROUGE 和 METEOR)主要奖励词汇相似性,并且常常无法检测临床后果性错误,例如遗漏诊断、幻觉发现或不一致的肿瘤属性。我们提出了用于病理报告生成的标准化基准和评估框架。该基准测试使用三个病理基础编码器(CONCHv1.5、UNI2-h 和 H-Optimus-1)评估三个数据集(TCGA、HistAI 和 REG 2025)中的四种代表性方法。我们的框架标准化了预处理、特征提取、训练、解码和评估,实现了模型之间的公平比较,同时提供了一个用于集成新方法、数据集和编码器的模块化平台。一个核心贡献是临床报告质量评分 (CRQS),这是一种基于临床的指标,用于评估事实的正确性。 CRQS 将参考和生成的报告映射为结构化临床属性,并测量四个互补维度:临床事实覆盖率、关键信息回忆、幻觉率和临床不一致,从而产生总体分数和可解释的子分数。实验表明,传统的语言生成指标与临床正确性的一致性较差,并且经常高估报告质量。相比之下,CRQS 揭示了词汇度量无法捕获的模型和编码器之间具有临床意义的差异。基准、公共即插即用框架和 CRQS 共同为病理报告生成的严格评估奠定了可重复的基础。