论文

手术操作中稀疏奖励强化学习的阶段初到 VLM 反馈

Phase-and-First-Arrival VLM Feedback for Sparse-Reward Reinforcement Learning in Surgical Manipulation

模型训练奖励建模与过程监督

摘要

稀疏的结果反馈限制了机器人从复杂操作的不成功尝试中学到的东西。失败的多阶段手术尝试可能包括值得重复使用的抓握、提升或转移。在稀疏奖励强化学习中,终端奖励会瓦解这种对相同结果的尝试,而标量视觉语言模型(VLM)评级既不能揭示哪些进步值得赞扬,也不能揭示何时发生。我们引入阶段和首次到达反馈:每个记录片段的一个 VLM 查询可识别最远的视觉验证任务阶段以及首次到达该阶段的时间,从而允许学习者重用部分行为并本地化信用。我们在 SurgPhaseBench(一个涵盖刚性和可变形任务的相结构套件)中对其进行实例化,并在仿真和硬件中对其进行评估。在五个模拟任务中,我们的方法达到了 75.2% 的平均成功率,而使用相同视觉输入的基于对比语言图像 预训练 (CLIP) 的奖励的平均成功率为 52.1%;当仅反馈表示发生变化时,优势仍然存在。在硬件上,相同的记录支持自主块拾取和滑动恢复。总之,这些结果表明,轨迹级视觉监督可以保留部分进展,同时提供稀疏奖励控制所需的时间信用。