论文

手术增强现实中的实时视觉障碍检测

Real-Time Visual Obstruction Detection in Surgical Augmented Reality

模型推理推理加速

摘要

手术增强现实 (AR) 可以通过将虚拟注释、工具提示和程序信息叠加到手术工作空间上来提供上下文指导。然而,虚拟内容可能会遮挡与任务相关的现实世界信息,例如手术器械,并在时间敏感的手术任务期间干扰用户的感知。在本文中,我们研究了手术 AR 的视觉障碍检测,并提出了一种延迟感知管道,它将基于视觉语言模型 (VLM) 的手术对象识别与基于分割的障碍推理相结合。为了减少推理开销,系统采用了从小到大级联的 VLM 架构,具有分段引导的早期退出和基于注意力的视觉标记修剪。当分段一致性支持其关键对象预测时,小型 VLM 可以处理简单的帧,而困难的帧则通过修剪后的视觉标记转发到大型 VLM。我们通过将虚拟内容叠加到手术工具图像上并标记虚拟内容是否阻碍任务相关仪器来构建伪 AR 手术阻塞检测基准。评估结果表明,该系统的障碍物检测准确率达到87.43%,平均端到端时延为479 ms,与云端大模型基线相比,时延降低了62.90%。这些结果证明了手术 AR 的延迟感知障碍物检测的可行性,并激发了未来在动态手术视频、多对象场景和临床基础 AR 指导内容方面的工作。