论文

迈向统一的手术场景理解:通过 MLLM 连接推理和基础

Towards Unified Surgical Scene Understanding:Bridging Reasoning and Grounding via MLLMs

应用与实践行业应用

摘要

手术场景理解是计算机辅助干预的基石。虽然最近的进展,特别是手术图像分割方面的进展,推动了进步,但现实世界的临床应用需要更全面的理解,共同捕获程序上下文、语义推理和精确的视觉基础。然而,现有的方法通常孤立地处理这些组件,导致碎片化的表示和有限的语义一致性。为了解决这一限制,我们提出了 SurgMLLM,这是一种统一的手术场景理解框架,可在单个模型内桥接高级推理和低级视觉基础。给定手术视频,SurgMLLM 微调多模态 大语言模型 (MLLM) 以支持结构化可解释性推理,该推理用于联合建模阶段、工具-动词-目标 (IVT) 三元组和三元组实体分割标记。然后,这些标记会暂时聚合并作为分割网络的提示,从而实现三元组仪器和目标的精确像素级像素定位。整个框架以统一的目标进行端到端训练,将基于语言的推理监督与视觉基础损失结合起来,促进连贯的跨任务学习和临床一致的场景表示。为了促进统一评估,我们引入了 CholecT45-Scene,通过与现有三元组标签对齐的仪器和目标的 64,299 帧像素级掩模注释扩展了 CholecT45 数据集。大量实验表明,SurgMLLM 显着提高了手术场景理解,将主要三元组识别指标 AP_IVT 从 40.7% 提高到 46.0%,并且在相位识别和分割方面始终优于现有方法。这些结果凸显了统一推理和基础对于可靠、上下文感知手术辅助的有效性。