论文

SAGE-OR:手术室的半监督自适应场景图生成

SAGE-OR: Semi-supervised Adaptive Scene Graph Generation for Operating Rooms

应用与实践行业应用

摘要

当前的手术场景图生成方法依赖于密集的多模态监督和专用硬件(同步 RGB-D 传感器、校准装置),使得数据集构建成本高昂,并将所有现有基准限制在模拟环境中。我们提出了 SAGE-OR,一种以特征为中心的框架,用解耦的表示推理范式取代了传统的检测然后推理范式,其中定位源自冻结的基础模型,隐式编码在预先计算的特征中,并且在没有任何定位监督的情况下使用,而轻量级图 Transformer 对缓存的特征执行关系推理。我们采用具有通用分割提示的半监督公式来消除本地化监督,同时通过额外的提示驱动实体(例如注释中缺少的手)实现无监督上下文增强。通用提示用于诱导近乎完美的回忆,而精确度则委托给下游基于注意力的推理,从而可以通过提示级别的修改来简单地适应新实体。该设计实现了轻量级 15M 参数图 Transformer,训练时间为 1.4 小时,每帧以 $\sim$1ms 的速度运行关系推理,峰值内存低于 2GB,适合手术室使用的边缘硬件;特征提取作为单独的缓存阶段离线运行(每帧 4.27 秒)。在 4D-OR 基准上,核心模型实现了 76% F1,与完全监督的 4D-OR 基线相匹配,同时消除了所有定位注释,无监督的手部增强将其提高到 86%,与需要密集多模态监督的最先进 (SOTA) 方法相比,相差 4 点,为适应新的手术设置提供了一条实用的途径,无需除关系和类标签之外的注释。