论文

US-VLA:腹部具体超声视觉-语言-动作模型

US-VLA: An Ultrasound Vision-Language-Action Model for Embodied Abdomina

摘要

人工智能辅助超声扫描通过为标准化图像采集提供实时指导并减少操作员依赖来提高诊断可靠性和效率。然而,现有的强化学习和学习辅助超声扫描方法通常依赖于精心设计的奖励函数或广泛的交互数据,这限制了它们在不同设备、患者群体和复杂临床场景中的泛化能力和稳定性。为了应对这些挑战,我们提出了一种用于自动超声扫描的超声视觉-语言-动作模型(US-VLA),该模型明确编码临床语义目标并在实时超声反馈下生成顺序探头操作动作。特别是,我们首先设计了一个超声感知专家融合模块,将超声观察与辅助上下文信息联合集成,使语义超声反馈能够有效指导扫描过程。然后,我们构建了 US-VLA-Data,这是一个涵盖肝脏和肾脏检查的真实数据集,其中包括五个临床定义的标准平面,并包含 320 个专家扫描轨迹,大约有 80,000 个同步时间步长。大量实验表明,US-VLA 在超声探头操作任务中实现了具有竞争力的性能,表明其在评估的腹部超声设置中的有效性和有前景的推广。源代码可在 https://github.com/VMVLab/US-VLA 获取。