论文

临床人工智能系统和医生以及前沿语言模型在初级保健诊断中的表现

Performance of Clinical AI System and Physicians and Frontier Language Models in primary care diagnostics

模型评测模型能力评测

摘要

临床人工智能评估应包括自适应信息收集后的诊断和管理。我们在 150 次综合波兰语初级保健咨询中比较了 Doctorina、八位医生和四种独立的前沿语言模型。 Doctorina 的 Top-1 一致性为 82.0%,而医生为 57.0%(差异 25.0 个百分点;95% 置信区间,17.7-32.7),主要或参考差异一致性为 97.3% 与 85.0%。在 149 个病例对中,标准化检查和治疗评分分别为 89.4 比 66.9 和 83.7 比 61.2。 Doctorina 在所有六组中具有最高的诊断点估计值; Kimi K3 排名第二,而 Claude Opus 5 领先 Opus、Doctorina 和 Kimi 的紧密管理估计。 Doctorina 的第二次执行在所有结果上都再现了优于医生的优势。因此,Doctorina 相对于医生的优势从初步诊断选择扩展到更高评价的诊断检查和适应性咨询后的初步治疗。