论文

从黑盒到玻璃盒:Ambient AI Scribe 文档中跨模型 ASR 分歧与 Prioto 审查

From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation

模型评测鲁棒性、公平性与可信度评测

摘要

环境人工智能“抄写员”系统有望减少临床记录负担,但如果不仔细检查,自动语音识别 (ASR) 错误可能会被忽视,而且高质量的人类参考转录本通常无法用于校准不确定性。我们研究异构 ASR 系统之间的跨模型分歧是否可以充当无参考不确定性信号,以优先考虑医疗转录工作流程中的人工验证。我们使用 50 个公开的医学教育音频剪辑(8 小时 14 分钟),使用涵盖商业 API 和开源引擎的 8 个 ASR 系统转录每个剪辑。我们对齐多模型输出,建立共识伪参考,并使用多数强度指标量化 词元级 协议;我们进一步按类型(内容与标点/格式)来表征分歧,并通过留一模型(折刀)共识评分来评估每个模型的一致性。模型间可靠性较低 (ICC[2,1] = 0.131),表明系统间存在异构故障模式。在 76,398 个评估的词元头寸中,72.1% 表现出近乎一致的一致性(7-8 个模型),而 2.5% 属于高风险范围(0-3 个模型),不同口音群体的高风险质量从 0.7% 到 11.4% 不等。低一致性区域因内容分歧而丰富,高风险质量五分位数的内容比例从 53.9% 增加到 73.9%。这些结果表明,跨模型分歧提供了稀疏的、可本地化的信号,可以在没有人工验证参考的情况下显示潜在不可靠的转录跨度,从而实现有针对性的审查;标记区域的临床准确性仍有待确定。