论文
Ran Score:以临床指导的发现提取评估放射学报告
Ran Score: a LLM-based Evaluation Score for Radiology Report Generation
摘要
胸部 X 光报告生成与自动评估受限于对低患病率异常的识别不佳,以及对否定、歧义等临床重要语言的处理不足。我们开发了一个临床医生引导的框架,结合人类专长与大语言模型,从自由文本胸部 X 光报告中进行多标签征象抽取,并用它定义 Ran Score——一种征象层面的报告评估指标。使用来自公开胸部 X 光数据集的三个互不重叠的 MIMIC-CXR-EN 队列和一个独立的 ChestX-CN 验证队列,我们优化提示词、建立放射科医生来源的参考标签并评估报告生成模型。优化后的框架在 MIMIC-CXR-EN 开发队列上将宏平均分数从 0.753 提升至 0.956,在可直接比较的标签上超出 CheXbert 基准 15.7 个百分点,并在 ChestX-CN 验证队列上表现出稳健的泛化能力。我们在此表明,临床医生引导的提示优化提升了与放射科医生参考标准的一致性,且 Ran Score 能够对报告保真度进行征象层面的评估,尤其针对低患病率异常。
