论文
BiliVLA:具有强化学习的场景感知视觉-语言-动作模型,用于自主胆道内窥镜导航
BiliVLA: Scene-Aware Vision-Language-Action Model with Reinforcement Learning for Autonomous Biliary Endoscopic Navigation
摘要
内窥镜逆行胰胆管造影 (ERCP) 需要在狭窄的单眼视野内进行精确的内窥镜导航和稳定的胆道插管,其特点是镜面反射、部分闭塞和频繁的组织接触。尽管最近的机器人系统和基于视觉的辅助技术改善了操作员的人体工程学并提供了感知线索,但它们的性能在明显的解剖变异性和安全关键的视觉伪影下下降,这阻碍了插管级手术的可靠自主性。在这里,我们提出了 BiliVLA,一种场景感知的视觉-语言-动作 (VLA) 框架,它将胆道内窥镜导航表述为指令条件下的视觉运动学习问题。给定内窥镜观察和阶段特定的语言指令,BiliVLA 联合预测连续内窥镜的目标类别、目标定位框和离散三自由度 (3-DoF) 运动命令。所提出的框架结合了场景感知监督以提高语义目标一致性和安全意识恢复监督以诱导管腔墙壁接触下的保守撤退行为。 BiliVLA 的一个关键组成部分是两阶段训练范例,它将定位增强监督 微调 (SFT) 与组相对策略优化 (GRPO) 相结合,从而提高闭环导航期间的动作可靠性和决策一致性。在三个 ERCP 子任务中,BiliVLA 在物理体模实验中取得了最佳的整体性能,总 mIoU 为 0.9625,整体动作精度为 91.96\%,整体成功率 (SR) 为 84.85\%。这些结果表明,整合语义定位、场景感知学习和奖励引导优化可以增强感知-动作对齐,并实现更强大的自主胆道内窥镜导航。