论文
面向临床医生的 EHR 嵌入式人工智能代理的端到端评估和治理
End-to-End Evaluation and Governance of an EHR-Embedded AI Agent for Clinicians
摘要
临床人工智能系统不仅需要时间点评估,还需要持续治理:在整个部署过程中持续监控、评估、迭代和重新评估性能。我们提出了一个端到端的治理框架,它集成了标题验证、实时部署反馈、技术性能监控和成本跟踪,以及部署前的受控实验门控系统更改。 Hyperscribe 是一种 EHR 嵌入式代理,可将环境音频转换为结构化图表更新,20 名临床医生在 823 个病例中编写了 1,646 个经过验证的评分标准。通过对照实验评估了 7 个 Hyperscribe 版本,中位分数从 84% 提高到 95%。对三个月内 107 个实时反馈条目的分析显示,随着工程干预解决了故障,反馈构成从 79% 错误报告和 14% 积极观察转变为 30% 错误和 45% 积极观察。每个音频片段的中位处理时间为 8.1 秒,在重试机制吸收瞬态模型错误后,有效完成率为 99.6%。这些结果表明,对已部署的临床人工智能进行持续、多渠道的治理是可以实现且有效的。