论文
FRAM:以未来轨迹选择局部视觉的紧凑机器人策略
FRAM: Trajectory-Guided Visual Feature Selection for Compact Language-Conditioned Robot Manipulation
摘要
视觉-语言-动作模型在机器人操作中实现了强大的性能,但通常需要大量参数。在这项工作中,我们提出了未来表示动作模型(FRAM),这是一个将未来末端执行器轨迹与当前视觉输入明确联系起来的小策略。 FRAM使用预测轨迹的图像坐标作为空间指针,并从当前图像中读取与运动相关的局部视觉特征。它将用于动作生成的信息组织为参考位置(Where)、视觉状态(What)和未来运动(Future)。轨迹标签是根据演示和相机几何形状自动生成的,因此不需要手动注释。凭借 138.7M 参数(包括冻结语言编码器),FRAM 在四个标准 LIBERO 套件的平均成功率达到 92.2%,接近具有 3.3B 参数的 $π_0$ 的 94.2%。无需额外训练,在 LIBERO-Plus 上也达到平均 67.3%。消融证实未来轨迹和局部视觉特征都提高了性能和鲁棒性。在真正的双臂 UR5e 上,FRAM 仅使用腕式摄像头堆叠杯子,包括在左右臂之间选择和切换。这些结果表明,基于未来运动选择视觉信息是在小型机器人策略中获得高性能和鲁棒性的有效方法。
