论文

LLM 法官验证存在,而不是缺席:人工智能临床记录中的遗漏盲症以及如何恢复它

LLM Judges Verify Presence, Not Absence: Omission Blindness in AI Clinical Notes and What Recovers It

模型评测评测方法与指标

摘要

Ambient AI 抄写员起草临床记录,并发表的审计发现他们的主要错误是遗漏:记录中未记录的信息。标准检查是 LLM 判断:第二个模型根据成绩单读取注释并标记问题。我们询问法官是否发现遗漏。公共语料库无法提供答案:他们的临床医生参考笔记和成绩单存在重大差异。我们的基准测试有 500 个来自经审计的情况说明书的单错误注释对,298 个肯定不存在命名事实,还有 202 个添加或更改的控制。在八个法官设计中,配对歧视(在其干净双胞胎下方的有缺陷的音符,抛硬币 0.5)在添加或更改内容上读数为 0.79-0.94,在遗漏内容上读数为 0.50-0.63。在单个音符上,没有任何设计比完美音符更能可靠地标记遗漏。措辞更改、投票和 GEPA 提示优化会移动操作点,但不会创建可用的检测。重组任务可以恢复它:列出记录所确定的事实,然后检查每个事实的注释。有两种方法可以独立实现并进行权衡:一种是基于事实的管道,另一种是通过 GEPA 演进的提示在一次调用中执行相同的操作。管道的标志指出了缺失的事实及其严重性(误报率为 2.7%)。单次调用检测到的误报率更高(36.9% 对 24.6%,p=0.002),误报率为 6.2%,每条记录的成本仅为十分之一。一位医师作者验证了 70 项,并且在两条路线不一致的情况下,在 10 项中的 10 项中站在了管道一边 (p=0.002)。第二位临床医生(而非作者)对严重程度进行了盲目分级,并同意在一个等级内。根据来自同伴普查的真实供应商记录,没有基准阈值转移,但重新校准的单次调用以一半的误报率检测到了八个中最好的一个。如果遗漏的事实在其他地方得到重述,这两条路线都会失败。我们发布基准、提示和判断。