论文
Jev 可以判断放射学报告吗?评估 System One 模型的临床真实性
Can Jev Judge Radiology Reports? Evaluating a System One Model for Clinical Factuality
摘要
人工智能生成的放射学报告可以类似于医生的报告,同时忽略异常情况、添加不受支持的发现或逆转其存在。衡量这些事实差异对于评估报告生成器至关重要。我们研究 Jev,一种 System One 决策模型,作为与医生编写的参考报告是否一致的简单、低成本的判断。我们的评估员会检查每项陈述是否得到另一份报告的支持,并将这些判断在两个方向上结合起来,以捕获不受支持的主张和遗漏。单问题配置在 RadEvalX 上达到 0.573 的 Kendall 相关性,在 RadEvalExpert 上达到 0.398 的专家错误计数,在匹配分解和聚合下优于开放自然语言推理判断。每个陈述一个支持问题保留了与七个类似的专家共识,同时使用的判断输入标记减少了 43-45%。按照记录的 API 价格,每百个报告对的判断成本低于 3 美分,不包括本地分解。在单独的受控错误测试中,Jev 检测到错误否定,AUROC 为 0.977。 Local RadMatch 在专家数据集中的临床显着错误和共享 RadEvalExpert 子集中的总错误上达成了更一致的协议。结果计数和错误范围分析表明,基准一致性反映了报告大小和错误定义以及医疗错误检测。这些结果支持 Jev 作为实用判断组件,用于衡量生成的放射学报告中的事实差异,并确定更详细的评估仍然有价值的地方。