论文

手术视频中稀疏功能地标定位的密集结构先验

Dense Structural Priors for Sparse Functional Landmark Localization in Surgical Videos

应用与实践行业应用

摘要

诸如 SAM 3 之类的视觉基础模型可以在不同的手术视频条件下提供可转移的对象级结构,但分割输出不会显式编码定义功能性手术标志的动作条件语义。估计器械范围和几何形状与定位与剪切、抓握或解剖相关的尖端或锚定器不同。我们研究了视觉基础模型支持的稀疏动作感知地标定位,使用零样本、点提示结构掩模来提供密集的仪器级上下文,而无需手动像素级掩模注释。我们提出了一个使用 SAM 3 作为结构先验的轻量级细化框架。粗略的多帧网络预测提示和锚点提示,生成与视觉和热图特征融合的非预言掩模,以细化功能性地标预测。我们比较直接掩模增强监督、预测衍生掩模先验细化和辅助掩模监督,以研究视觉基础模型衍生结构应如何进入面向精度的定位系统。对来自 YouTube、Cholec80、HeiChole、SurgVU 和 CRCD 的 60 个手术视频的 7,867 个剪辑进行的实验评估了异构条件下的方法。在没有用于训练的手动像素级掩模注释的情况下,所提出的模型的提示的总体 F1 得分为 72.4%,锚点定位的总体 F1 得分为 58.0%。消融表明,从粗到细的细化提供了显着的性能增益,而预测导出的结构先验在作为中间指导而不是直接定位目标合并时提供了额外的改进。