论文
SWIM:以视觉语言条件生成软体机器人的全身操作序列
SWIM: Vision-Language-Grounded Soft Whole-Body Interactive Manipulation
摘要
软体和连续体机器人可以通过分布式身体变形和接触进行操纵,但将语言和视觉上下文转化为可执行的全身驱动仍然是一个基本挑战。我们提出了 SWIM,一个将初始 RGB 观察和语言指令映射到完整的驱动命令序列的框架。其视觉-语言-动作 (VLA) 策略 SWIM-VLA 通过 RGB 观察、语言指令和肌腱状态的共享表示,将扩散动作头与视觉软本体感觉 (VSP) 结合起来。扩散头对专家命令块的条件分布进行建模,而 VSP 使用仿真真值监督有序的身体锚点预测,鼓励表示在从有限的演示中学习时保留身体几何形状。体现的机械智能支持通过不断发展的模拟观察的迭代虚拟轨迹推演生成的命令序列的物理执行,并具有内在的合规性,无需在线策略查询即可提供本地接触适应。我们评估了 SWIM 在平面腱驱动软机器人上的包装、到达和抓取功能,并锚定了抓取目标。在模拟中,SWIM-VLA 的成功率分别为 100%、96% 和 88%,优于经过调整的 OpenVLA-OFT 基线和受控消融。在硬件上,SWIM 的成功率分别为 100\%、80\% 和 75\%,而同一策略检查点直接在线部署的成功率分别为 75\%、40\% 和 25\%。