论文

双模型建议与单模型建议对住院医师阅片的影响

Dual- versus Single-Suggestion AI Support for Radiographic Interpretation in Residents: Randomized Multireader Study

应用与实践模型评测模型能力评测行业应用

摘要

目的:比较双建议和单建议人工智能对居民放射照相判读的支持,特别是当共享的人工智能建议不正确时。材料和方法:这项前瞻性、多中心、随机三臂阅读器研究于 2026 年 7 月至 9 月在中国三家医院进行(ChiCTR2600129243)。经过专业分层后,132 名临床经验不足 3 年的住院医生按 1:1:1 随机分配至单独使用 GPT-5.4(A 组)、GPT-5.4 加 Kimi-K2.6(B 组)或 GPT-5.4 加 Gemini-3.6 Flash(C 组);分析了 123 个。参与者在人工智能支持之前和之后解读了 60 张射线照片。主要结果是准确性的变化。 Welch 方差分析和 Holm 调整 t 检验比较了支持条件; HC3 线性模型评估专业交互。结果:在 123 名住院医师(平均年龄 24.1 岁 +/- 1.4;65 名女性)中,放射科住院医师在双重建议支持下的准确性比单一建议支持的提高更大(B-A,6.69 个百分点 [95% CI,0.97-12.40];C-A,7.87 个百分点 [95% CI,1.64-14.11];Holm 调整 P = .030 两者),而准确性变化在非放射科住院医师中没有差异(P = .20)。当 GPT-5.4 不正确时,放射科住院医师(40.1% 和 40.4% vs 20.0%)和非放射科住院医师(31.3% 和 31.0% vs 12.1%)中双重建议支持的人工智能辅助准确性更高(所有 Holm 调整后的 P < .001)。双重建议效应因专业而异(交互作用差异,10.44 个百分点;95% CI,4.36-16.52;P < .001)。结论:双重建议支持可以减轻人工智能错误建议的影响,在放射科住院医师中观察到更大的准确性提高,但在非放射科住院医师中却没有。

双模型建议与单模型建议对住院医师阅片的影响:论文原图
图 2:读者工作流程和 AI 支持条件。 a,无需人工智能辅助的初步解读,包括诊断和置信度。 b,人工智能协助单建议支持(A 组,GPT-5.4)或两个并行双建议条件之一(B 组,GPT-5.4 加 Kimi-K2.6;C 组,GPT-5.4 加 Gemini-3.6 Flash)后的最终解释。在两种双重建议条件下,两个人工智能建议都是同时提出的。