SurgTEMP:用于腹腔镜胆囊切除术的具有文本引导视觉记忆的时间感知手术视频问答
SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy
摘要
手术过程本质上是复杂且危险的,需要广泛的专业知识和持续的关注来驾驭不断变化的术中场景。手术视觉问答 (VQA) 等计算机辅助系统为教育和术中支持提供了希望。目前的外科 VQA 研究主要集中在静态帧分析,忽略了丰富的时间语义。手术视频问答还受到低视觉对比度、高度知识驱动的性质、跨越分散时间窗口的多样化分析需求以及从基本感知到高级术中评估的层次结构的进一步挑战。为了应对这些挑战,我们提出了 SurgTEMP,这是一种多模式 LLM 框架,具有 (i) 一个查询引导的词元选择模块,用于构建分层视觉记忆(空间和时间记忆库)和 (ii) 外科能力进步 (SCP) 训练方案。它们共同实现了可变长度手术视频的有效建模,同时保留手术相关线索和时间一致性,并更好地支持各种下游评估任务。为了支持模型开发,我们引入了 CholeVidQA-32K,这是一个手术视频问答数据集,包含来自腹腔镜胆囊切除术的 32K 开放式 QA 对和 3,855 个视频片段(总共约 128 小时)。该数据集分为三级层次结构——感知、评估和推理——涵盖从仪器/动作/解剖感知到安全批判性观点 (CVS)、术中难度、技能熟练程度和不良事件评估的 11 项任务。在针对最先进的开源多模态和视频 LLM(微调和零样本)的综合评估中,SurgTEMP 实现了显着的性能改进,推动了基于视频的手术 VQA 的发展。项目页面位于:https://camma-public.github.io/SurgTEMP/