论文

三分之一:对三名部署的人工智能抄写员进行了经过验证的人口普查,以及计算它的工具

One note in three: a verified census of three deployed AI scribes, and the instrument that counted it

模型评测安全与风险评测

摘要

Ambient AI 抄写员在临床医生签署每份记录的保证下起草临床记录。我们在相同的 142 次咨询中审核了三位商业人工智能抄写员:来自记录的英国初级保健和美国流动遭遇以及编写的场景的 565 条笔记。 12 次发现过程提出了 13,678 个候选错误; 5,898 名通过重要性过滤器的人进入了由来自不同家族的两个模型组成的对抗小组,每个模型都被告知要反驳它可以反驳的内容,最终 618 名幸存下来。三分之一的纸条(31.3% [27.0, 35.6])带有经过验证的失败,集中在过敏和药物信息、捏造的患者身份以及在电话咨询检查中写下的历史记录,但其中不包含任何内容。没有向产品提供患者记录;抛开记录预填的两个类别、发明的身份和日期,该比率为 24.8% [20.8, 29.0]。一种失败模式不适合我们的方案,该模式取自已发布的抄写错误分类法:临床医生撤回的治疗,记录为交付的护理。两名临床医生裁定了盲法、不相交的样本:一名医生作者维持了 21 项研究结果中的 20 项 (95.2% [77.3, 99.2]),而一名独立临床医生而非作者,维持了 12 项研究结果中的 12 项 ([75.8, 100]);两人都认为每一次拒绝抽样都是真实的。故障率取决于仪器和抄写员。在模型、证据和设置固定的情况下,仅审查指令就将经过验证的候选者比例从 9.3% 提高到 79.0%,审查家庭也进行了调整:仅在该指令下,较温和的人就将 54.8% 的笔记标记为 27.8%。根据标准,28% 到 97% 的样本纸币不合格。已发布的审计结果之间存在一定的分歧,仅工具差异就可能产生:他们的错误率为 54-86%,而我们的错误率为 23.1%。我们发布了所有 618 项调查结果,包括转录证据、每个提示和模型版本以及可重新运行的管道。