论文

用于自适应超声引导进针和进针跟踪的视觉-语言-动作模型

A Vision-Language-Action Model for Adaptive Ultrasound-Guided Needle Insertion and Needle Tracking

摘要

由于动态成像条件和针可视化的困难,超声(US)引导的针插入是一个关键但具有挑战性的过程。人们已经提出了许多用于自动针插入的方法,但它们通常依赖于带有模块化控制器的手工制作的管道,其性能在具有挑战性的情况下会下降。在本文中,提出了一种视觉-语言-动作(VLA)模型,用于在机器人超声(RUS)系统上进行自适应和自动化的超声引导针插入和跟踪。该框架提供了统一的针跟踪和针插入控制方法,能够根据获得的针位置和环境感知实时、动态地自适应调整插入。为了实现实时和端到端的跟踪,提出了一种跨深度融合(CDF)跟踪头,集成了来自大规模视觉主干的浅层位置和深层语义特征。为了适应跟踪任务的预训练视觉主干,引入了跟踪调节(TraCon)寄存器以实现参数高效的特征调节。针跟踪后,提出了用于自适应针插入控制的不确定性感知控制策略和异步 VLA 管道,确保及时做出决策,以提高安全性和结果。关于针跟踪和插入的大量实验表明,我们的方法始终优于最先进的跟踪器和手动操作,实现了更高的跟踪精度,提高了插入成功率,并减少了手术时间,突出了基于 RUS 的智能干预的有希望的方向。