论文
对象标记作为机器人手术中分割和视觉问答之间的桥梁
Object Tokens as a Bridge Between Segmentation and Visual Question Answering in Robotic Surgery
摘要
机器人手术中的视觉问答(VQA),简称手术VQA,需要对复杂手术场景的高度理解,并将视觉感知与语言推理相结合,具有支持手术训练和术中决策的潜力。最近的视觉语言模型(VLM)通过参数高效的 微调 显示出有希望的性能;然而,大多数现有方法依赖于粗略的视觉定位,通常仅限于边界框,无法捕获手术对象的细粒度空间结构。在这项工作中,我们提出了一个统一的框架,在单个框架内联合执行像素级分割和视觉问答。我们的方法将 VLM 与基于分段任意模型 (SAM) 的解码器集成,并将场景元素表示为 VLM 生成的对象标记。这些对象标记指导答案预测,并进一步投射到基于 SAM 的解码器以生成分段掩模。通过分割和问答目标优化对象标记嵌入,该模型学习空间空间定位表示,增强视觉推理,同时提供明确的像素级空间定位。我们在私人 RAMIE(机器人辅助微创食管切除术)数据集和公共 EndoVis18 数据集上评估了所提出的方法,它始终优于外科 VQA 的基线方法。这些结果表明,将上下文感知对象标记合并到视觉语言模型中可以改善细粒度的手术场景理解。