论文

PEARS:以失败推理与物理先验适配触觉操作

PEARS: Physical-Prior-Guided Efficient Adaptation via Failure Reasoning and Diffusion Steering for Tactile Manipulation

摘要

预训练的机器人策略在部署过程中遇到的分布外 (OOD) 条件下可能会遭受严重的性能下降,从而通过现实世界的交互来激励 后训练。然而,基于强化学习 (RL) 的 后训练通常需要大量的环境交互,这种负担在操作中尤其重要,因为每次试验都可能缓慢、成本高昂或具有破坏​​性。因此,我们提出了 PEARS,这是一种物理先验引导的混合强化学习框架,用于通过触觉反馈对预训练的策略进行样本高效的在线适应。在每个情节之后,其物理引导力推理(PFR)模块使用视觉语言模型(VLM)中编码的物理先验来根据视觉结果和触觉交互历史诊断故障,并更新适合任务的接触力界限。然后,高频混合力-位置控制器在接触期间强制执行这些界限。作为补充,触觉条件扩散转向强化学习可调整冻结流匹配策略的潜在噪声,以纠正自由空间运动和接触计时中的错误,而无需更新基础模型。在模拟中,PEARS 将成功率比最强的每任务基线提高了 12.4-37.4 个百分点。相对于最快的基线,PEARS 还将达到一定成功阈值所需的交互次数减少了高达 53.2%。在实际实验中,PEARS 在白板擦除方面的成功率达到 95%,在吸液管液体抽吸方面的成功率达到 90%。这些结果表明,将 PFR 模块与策略转向系统相结合可以加速适应,同时减少昂贵的交互。该项目网站位于https://song-kun.github.io/pears.

PEARS:以失败推理与物理先验适配触觉操作:论文原图
图 2:白板擦拭过程中的阶段感知力控制。