论文

机器人辅助手术中的实时多模式活动感知错误检测

Real-Time Multimodal Activity-Aware Error Detection in Robot-Assisted Surgery

应用与实践行业应用

摘要

机器人辅助微创手术提高了手术精度,但也带来了复杂性,因此技术错误检测对于确保患者安全至关重要。当前使用视频数据的执行错误检测方法常常忽略外科手术的层次结构内的活动和错误类型的细粒度上下文描述。他们还没有充分利用互补的多模式信息。我们提出了一个统一的执行错误检测框架,该框架利用多模式输入,包括视频、运动学和描述性文本提示。通过活动提示,我们将描述性语言集成到手势级活动、仪器-对象交互和错误定义中。我们还引入了源自在手术活动标签上预训练的视觉编码器的活动感知视觉嵌入,以比较对比语言图像嵌入与传统的基于图像的嵌入在错误检测方面的有效性。通过将运动学数据与视频和文本模式无缝集成,我们的框架显着提高了错误检测性能。与 JIGSAWS 和 SAR-RARP50 数据集上最先进的基线相比,我们的 F1 分数分别提高了 5\% 和 16.6\%,证明了将精心策划的文本提示与多模式数据相结合以实现准确错误检测的价值。