论文
ForceU-VLA:用于实体超声扫描的力感知视觉-语言-动作模型
ForceU-VLA: A Force-Aware Vision-Language-Action Model for Embodied Ultrasound Scanning
摘要
体现智能超声扫描通过融合感知、决策、执行能力,实现超声检查过程的自动化和标准化。然而,现有方法受到力和超声模态之间松散耦合建模的影响,并且缺乏对扫描阶段的认识,这限制了它们捕获动态探针-组织相互作用的能力。为了解决这些问题,我们提出了 ForceU-VLA,这是一种用于自主超声扫描的力感知视觉-语言-动作模型,它在整个扫描过程中利用力信号和超声图像反馈来实现准确和高质量的超声采集。首先,我们提出了一种力-超声协同融合模块(FUSFM),它协同融合超声视觉和力反馈信息,为探头运动提供稳定、可靠的引导。其次,提出了阶段自适应调制机制(SAMM),通过自适应调制多模态特征来提高其表示质量,以适应不同扫描阶段的任务要求。此外,我们还推出了 ForceU-VLA-Data,这是一个真实世界的力感知超声数据集,它集成了视觉、力和动作信号,包括来自五个代表性临床扫描视图中两个器官的数据,并包含 450 个专家收集的轨迹和大约 100,000 个同步多模态帧。大量实验结果表明,ForceU-VLA显着提高了超声扫描中的接触稳定性和探头压力调节能力,从而有效提高了任务执行质量和整体系统可靠性。源代码可在 https://github.com/VMVLab/ForceU-VLA 获取。