论文
PET/CT 放射学报告的错误检测:特定领域与 大语言模型
Error Detection for PET/CT Radiology Reports: Domain-Specific vs Large Language Models
摘要
放射学报告中的错误可能会对患者治疗产生不利影响,但自动化报告质量保证仍然具有挑战性,因为错误通常很微妙,需要领域专业知识才能检测到。尽管 大语言模型 (LLM) 最近被提议用于放射学报告验证,但它们检测胸部 X 射线数据集之外的临床有意义的错误的能力仍有待探索。为此,我们首次对用于 PET/CT 报告错误检测的语言模型进行了系统评估,将紧凑的特定领域模型与 SOTA 开放权重 LLM 进行了比较。 10 年来,我们收集了 23 名放射科医生的 30,633 份肿瘤学 FDG PET/CT 报告。我们训练了特定领域的 BERT 模型来检测临床动机的合成报告错误,并在 11,500 份报告的保留基准上与零/少样本 Qwen3-32B、Gemma-3-27B 和 Llama-3.3-70B 一起进行评估。 15M 参数模型的平衡准确度为 94.4%,假阳性率为 5.8%,而最强提示 LLM 的假阳性率为 84.0%。 Llama-3.3-70B 的特定任务适应缩小了这一性能差距 (94.4%),但保留了更高的计算要求。我们的结果表明,针对 PET/CT 报告错误检测,特定领域的训练比模型规模更重要,支持紧凑模型作为自动化放射学报告质量保证的准确且计算高效的方法。