论文
大语言模型在结直肠息肉光学诊断中的表现
Performance of large language models in the optical diagnosis of colorectal polyps
摘要
背景和研究目的:结直肠息肉的准确光学诊断指导切除策略和监测,多模态 大语言模型 (MLLM) 显示出基于图像的诊断潜力。我们的目的是评估 MLLM 在结直肠息肉分类和预测组织学方面的诊断准确性。方法:我们使用 PRIME 数据集(一组精选的白光和窄带成像 (NBI) 图像)进行了回顾性诊断性能研究。我们评估了 Claude Opus 4、Google Gemini 2.5 Pro、GPT-o3、GPT-4o 和 GPT-5。对于巴黎的窄带结直肠内窥镜成像 (NICE) 和预测组织学,我们计算了 F1 分数、正确分数百分比以及每个 MLLM 的准确性,与 132 个病例的专家回答进行比较。 Cochran 的 Q 和 McNemar 的检验用于确定每个 MLLM 的预测值之间的差异。结果:所有肿瘤性息肉模型与非肿瘤性息肉模型的 MLLM 中的 F1 评分均 >0.9。 Gemini 2.5 Pro 在侵袭性与非侵袭性息肉以及低级别与高级别腺瘤方面表现出最高的 F1 分数,分别为 0.560 和 0.492。根据巴黎分类,Claude Opus 4 和 GPT-5 的正确率在统计学上显着高于其他 MLLM,为 41.7%。结论:Claude Opus 4 和 Gemini 2.5 Pro 在区分息肉亚型方面表现出最高的准确度,最接近专家共识。然而,敏感性和特异性不符合 ESGE 标准,凸显了在临床部署之前进行前瞻性多中心试验和人机交互工作流程设计的必要性。