论文

使用基础表示进行上下文学习的外科解剖识别

Surgical Anatomy Recognition with Context Learning using Foundation Representations

模型评测基准与评测资源

摘要

准确识别解剖结构对于安全有效的微创手术 (MIS) 至关重要,但由于主要针对自然场景定制的注释数据和方法有限,因此在外科计算机视觉中仍然没有得到充分探索。在这项工作中,我们提出了一个组合的数据集和模型框架,以推进 MIS 中的解剖感知感知。首先,我们介绍 ATLAS-120k,这是一个大规模剪辑级语义分割数据集,包含来自 100 个手术视频的 120,000 多个带注释的帧,涵盖 14 个程序和多种模式,包括腹腔镜手术和机器人辅助手术。该数据集捕获了大量的程序变异性,并使用可扩展的注释管道创建,该管道集成了专家手动标记、自动传播、迭代细化和外科医生验证,以确保高质量的注释。其次,我们提出了 ATLAS(使用基础表示进行上下文学习的解剖识别),这是一种专门为外科解剖识别设计的视频语义分割模型。与强调对象跟踪的传统方法不同,ATLAS 利用基础模型嵌入和轻量级时间推理来合并手术类型、手术阶段和短期视觉记忆等上下文线索。这种设计可以实现时间上一致且准确的预测,同时保持实时可行性。该数据集和模型共同为强大的手术场景理解奠定了实践基础,并支持开发临床适用的微创手术引导系统。模型、数据集注释和注释平台可公开获取:https://github.com/TimJaspers0801/ATLAS。