论文

Ran Score:以临床指导的发现提取评估放射学报告

Ran Score: a LLM-based Evaluation Score for Radiology Report Generation

模型评测评测方法与指标

摘要

胸部 X 光报告生成与自动评估受限于对低患病率异常的识别不佳,以及对否定、歧义等临床重要语言的处理不足。我们开发了一个临床医生引导的框架,结合人类专长与大语言模型,从自由文本胸部 X 光报告中进行多标签征象抽取,并用它定义 Ran Score——一种征象层面的报告评估指标。使用来自公开胸部 X 光数据集的三个互不重叠的 MIMIC-CXR-EN 队列和一个独立的 ChestX-CN 验证队列,我们优化提示词、建立放射科医生来源的参考标签并评估报告生成模型。优化后的框架在 MIMIC-CXR-EN 开发队列上将宏平均分数从 0.753 提升至 0.956,在可直接比较的标签上超出 CheXbert 基准 15.7 个百分点,并在 ChestX-CN 验证队列上表现出稳健的泛化能力。我们在此表明,临床医生引导的提示优化提升了与放射科医生参考标准的一致性,且 Ran Score 能够对报告保真度进行征象层面的评估,尤其针对低患病率异常。

Ran Score:一种基于 LLM 的放射学报告生成评估分数:论文配图
图 1:从胸部 X 光报告中提取多标签发现的人类与LLM协作框架。 (a) 从 3,000 份胸部 X 光报告中探索性提取和聚类疾病相关实体,为标准化发现标签的定义提供信息。 (b) 通过六名经委员会认证的胸部放射科医生对报告进行独立的二进制注释,建立诊断参考标准。 (c) 以气胸为例说明人类-LLM 协作工作流程,显示基于误差分析的迭代临床医生指导的提示细化,以提高发现级别的提取性能,从而与放射科医生得出的参考标准更加一致。