论文

SurgNarrator:用于手术视频理解的生成检索框架

SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding

应用与实践行业应用

摘要

手术过程以结构化和反复出现的临床事件的形式展开,通过术中手术视频实时了解这些事件对于术中决策和支持至关重要。然而,现有的视频理解方法迫使人们进行权衡:自回归视频语言模型支持综合推理,但对于时间敏感的临床应用来说并不实用,而对比模型提供低延迟,但难以处理复杂的场景理解。最近,生成检索已被探索用于一般领域的视频理解,但将其转移到手术中并非易事,因为几乎相同的视觉外观可能表明语义上不同的事件,并且所涉及的术语是高度手术特定的。为此,我们提出了 SurgNarrator,一种专为手术视频理解而定制的新生成检索框架。我们从手术说明中构建了精心策划的以手术为中心的词汇表,以定义具有临床意义的检索空间。然后,我们采用预先训练的 Qwen3-VL-Embedding-8B 来学习具有时间感知对比目标的判别性临床表征。在推理过程中,分层的、过程感知的检索策略将搜索空间缩小到相关的过程类型,从而提供快速有效的响应。我们的方法在零样本设置下的十二个基准上进行了全面评估,并与最先进的基线相比实现了一致的性能增益,同时与生成基线相比将输出级延迟减少了两个数量级以上。