论文

外科人工智能的比较研究:数据集、基础模型和 Med-AGI 的障碍

A Comparative Study in Surgical AI: Datasets, Foundation Models, and Barriers to Med-AGI

模型评测模型能力评测

摘要

最近的人工智能(AI)模型在生物医学任务性能的几个基准方面已经达到或超过了人类专家,但在手术图像分析基准方面却落后了。由于手术需要整合不同的任务——包括多模态数据集成、人机交互和物理效应——如果性能能够得到改善,通用人工智能模型作为协作工具可能会特别有吸引力。一方面,扩展架构大小和训练数据的规范方法很有吸引力,特别是因为每年生成数百万小时的手术视频数据。另一方面,为人工智能训练准备手术数据需要更高水平的专业知识,并且对该数据的训练需要昂贵的计算资源。这些权衡描绘了一幅关于现代人工智能是否以及在多大程度上可以帮助外科手术的不确定图景。在本文中,我们通过使用 2026 年最先进的人工智能方法进行手术工具检测的案例研究来探讨这个问题。我们证明,即使有数十亿个参数模型和广泛的训练,当前的视觉语言模型仍然无法完成神经外科手术中看似简单的工具检测任务。此外,我们展示的扩展实验表明,增加模型大小和训练时间只会导致相关性能指标的改进逐渐减少。因此,我们的实验表明,当前的模型在外科手术用例中仍然可能面临重大障碍。此外,一些障碍不能通过额外的计算简单地“缩小”,并在不同的模型架构中持续存在,这就提出了数据和标签可用性是否是唯一限制因素的问题。我们讨论了这些限制的主要因素并提出了潜在的解决方案。

外科AI比较研究:数据、算力与扩展的潜力与局限:论文配图
图 1:来自 SDSC-EEA 的示例帧以及来自 Gemma 3 27B 的零样本预测。顶行:正确检测(从左到右:钻孔 + 抽吸;抽吸;钻孔 + 抽吸;无工具;无工具)。底行:不正确的检测,从左到右:yy = 钻、吸; y^\hat{y} = 刮匙、抓握器、冲洗、单极电灼、抽吸; yy = 棉饼、Rhoton 解剖器、抽吸; y^\hat{y} = 抓握器、单极电灼、抽吸; yy = 双极镊子,抽吸; y^\hat{y} = 刮匙、钻头、抽吸器、组织剃须刀; yy = 吸力; y^\hat{y} = 抓握器、单极电灼、抽吸; yy = 罗顿解剖器; y^\hat{y} = 单极电灼,抽吸。