论文

未提及的检查表发现改变了强化学习改善胸部X光报告检查的方式

Unmentioned Checklist Findings Change How Reinforcement Learning Appears to Improve Chest Radiograph Report Checking

模型评测评测方法与指标

摘要

放射学报告的自动检查可能依赖于人工智能生成的清单,而这些清单并未提及调查结果。我们使用强化学习来训练视觉语言模型,以在不查看被测试句子的情况下填写胸片中的 12 个检查结果清单;一个单独的检查模型从清单中判断句子。在留出患者上,基于规则的检查和独立医学检查(均未在训练中使用)测得区分能力增益(约登指数)分别为 12.6% 和 11.8%;只有基于规则的检查符合预先指定的误报标准。切换到训练格式(修复发现顺序并将未提及的发现输入为不存在),提高了训练检查器的测量增益并降低了独立检查器的测量增益,预先指定的比较产生 6.2%(95% 区间 2.0% 至 10.5%),事后留出患者为 7.7%。在 8 个检查模型中,对未提及的发现的与标签一致的负面陈述的接受程度从 1.0% 到 97.0% 不等。标签是根据报告得出的,而不是由放射科医生裁定的。

未提及的检查表发现改变了强化学习改善胸部X光报告检查的方式的原论文方法或结果图
图1:“未提及”是否意味着“缺席”?在看不到报告句子的情况下,AI 模型会填写一张清单,其中包含 1 张 X 光照片中的 12 种可能发现,此处简要显示了 1 项说明性 CheXpert Plus 研究的自由文本注释。该检查表没有胸腔积液的条目,尽管它的一般说明是“这张射线照片中没有看到其他异常情况。”句子“无胸腔积液”。同意该研究的报告衍生标签。两种检查模型都会拒绝生成的清单上的句子,并接受训练格式的句子,这会将结果按固定顺序排列,并将未提及的结果输入为不存在。因为一般注释本身可以被解读为排除积液,所以该示例显示缺少特定发现的条目,而不是完全沉默。在 237 个匹配的验证对中,切换到训练格式会将区分能力 ($Y$) 中使用的检查器的训练增益从 3.8% 移动到 6.0%,对于独立医疗检查器从 7.0% 移动到 3.1%。