论文

SurgVIL:利用开源手术视频扩展手术机器人模仿学习

SurgVIL: Scaling Surgical Robot Imitation Learning with Open-source Surgical Videos

模型训练监督微调与指令调优

摘要

基于学习的手术机器人自主性需要通过同步视频和机器人动作进行大规模演示,但此类数据在临床或现实组织环境中极其罕见,因为机器人运动学通常无法在受控研究系统之外访问。相比之下,在研究平台上收集的幻像数据提供了准确的动作标签,但缺乏真实组织的视觉多样性。我们提出了 SurgVIL,一个使用开源手术视频扩展手术机器人模仿学习的框架。 SurgVIL 将运动学标记的模型机器人演示与来自开源数据集和在线资源的手术视频相结合,用于政策学习。由于这些视频缺乏机器人运动标签,我们将近似运动学估计为弱监督。我们在两项达芬奇机器人任务上评估 SurgVIL:针拾取和胆囊切除术切割。在 ACT、$π_0$ 和 GR00T-H 主干网络中,添加手术视频极大地提高了对真实组织和分布外设置的泛化能力,这表明了从模型训练到通用手术机器人策略的可扩展路径。