论文
RadMatch:通过发现级别匹配进行可审核的放射学报告评估
RadMatch: Auditable Radiology Report Evaluation via Finding-Level Matching
摘要
随着人工智能系统越来越多地用于起草放射学报告,可靠地评估其临床质量仍然是一个严峻的挑战。基于 大语言模型 (LLM) 的指标现在与放射科医生的判断相关性最好,但它们输出一个单一的不透明分数,临床医生和模型构建者都无法轻松解释或审核。我们引入了 RadMatch,这是一种基于 LLM 的多阶段指标,它将报告比较分解为结构化的发现级别匹配,并在七个临床属性维度(状态、位置、严重性、形态、确定性、纵向比较和测量)中进行显着性评分和错误表征。主要分数是可操作错误计数,既可解释又可审计。候选结果被评定为正确、部分或不正确,不匹配的结果被视为遗漏或幻觉。分类和可操作的安全召回/精确度以及每个子集视图添加了互补的、面向部署的镜头。在两个专家基准测试中,RadMatch 是临床上最一致的指标,与 ReXVal 上的放射科医生间一致,并且是较难的 RadEvalExpert 上最佳先验指标的两倍多。它仅依靠几次提示,旨在扩展到其他模式和解剖结构。我们将把 RadMatch 作为开源代码发布,并带有用于检查结果的交互式仪表板。