论文
EndoWAM:用于通用内窥镜导航的扎根世界动作模型
EndoWAM: A Grounded World-Action Model for Generalizable Endoscopic Navigation
摘要
自主内窥镜导航可以减轻临床医生的操作负担,但由于组织变形、短暂闭塞和快速变化的视点,鲁棒控制仍然具有挑战性。现有的基于学习的策略通常根据当前观察来预测行动,而无需明确建模未来动态,从而限制了它们在安全关键环境中的稳健性和可靠性。世界动作模型(WAM)通过将预测视觉动态与动作生成相结合,提供了一种有前途的替代方案,但由于训练数据有限、视角多样性有限、可变形解剖结构和高推理延迟,将其扩展到机器人内窥镜检查仍然具有挑战性。我们推出了 EndoWAM,据我们所知,这是第一个用于通用机器人内窥镜导航的 WAM。 EndoWAM 引入了未来基础,它可以根据视频世界模型的中间去噪特征来预测未来观察中与任务相关的目标区域。具体来说,EndoWAM 通过共享预测表示将用于未来目标区域预测的轻量级扩散 Transformer 与离散动作专家结合起来。该设计将目标感知监督注入到预测动力学建模中,提高了对视觉退化和视点变化的鲁棒性,同时在单次降噪过程中实现实时控制。我们进一步介绍了 EndoMotion,这是一个机器人内窥镜运动数据集,涵盖三个解剖学上不同的手术:输尿管镜检查、食管镜检查和内镜逆行胰胆管造影(ERCP)。 EndoWAM 始终优于所有基线和替代目标定位策略,同时展示了对看不见的观点、环境和目标的强大的零样本泛化能力。这些结果将 EndoWAM 确立为一种预测性、基于目标的框架,可在视觉受限的内窥镜环境中进行准确、可推广和长范围的导航。