论文

用于语言可操纵和力响应操纵的原子运动坐标

Atomic Motion Coordinate for Language-Steerable and Force-Responsive Manipulation

模型架构新型架构

摘要

是否可以仅更改语言指令来重定向 VLA 策略的末端执行器,或者视觉驱动的运动先验是否占主导地位?我们提出了原子运动坐标,这是一种基于几何的坐标,用于可操纵和力响应操纵。每个手臂拥有十三个带符号的平移、旋转和保持原子,这些原子基于文本和前向运动学,并且保留视觉,并且坐标通过加权密码本对齐注入到每个动作专家块中。接触历史通过有界球面残差来调整相同的坐标,该残差是根据固定的标称潜在值重新计算的,以仅重新生成未执行的地平线后缀。在 7,520 次离线水平干预中,相对原子分离达到 92.5/83.1%(单/双),而 LA4VLA 类型为 39.1/24.0%。在每项任务 50 次真实机器人试验中,AMC 将 OOD 水果进度从 60.5% 提高到 87.8%;力适应将插头/花瓶从 59.0/71.5% 提高到 78.5/75.2%。