论文

ReGround-Surg:用于参考手术视频分割的可靠性引导锚定位

ReGround-Surg: Reliability-Guided Anchor Grounding for Referring Surgical Video Segmentation

模型架构Transformer

摘要

手术视频分割需要根据自然语言表达跨视频​​帧分割目标器械或组织区域。最近基于分段任意模型 2 (SAM2) 的两阶段方法(例如 ReSurgSAM2)首先将参考目标定位在初始或选定的帧中,然后通过跟踪传播选定的掩模。虽然有效,但它们的性能对初始定位掩模的质量高度敏感:一旦选择了不正确的锚点,后续跟踪往往会传播错误。由于视觉上相似的器械、遮挡以及复杂的组织-工具相互作用,这个问题在手术视频中尤其具有挑战性。为了解决这个问题,我们提出了 ReGround-Surg,这是一种轻量级可靠性引导锚定位框架,用于改进基于 SAM2 的参考手术视频分割。它首先根据引用表达和当前帧视觉特征预测文本条件的空间可靠性图。然后,该图在两个互补的分支中重用:门控侧适配器在文本到视觉融合之前增强与表达相关的视觉区域,而可靠性加权视觉到文本注意模块在提示词元聚合期间抑制脱靶视觉证据。 Ref-EndoVis17 和 Ref-EndoVis18 上的实验表明,在三个评估分组中,与最先进的方法相比,其得到了一致的改进,速度降低可以忽略不计。代码可在 https://github.com/JiaxinWen1/ReGround-Surg 上公开获取。