论文
FM-VLA:基于力的记忆,用于多接触操作中的视觉-语言-动作模型
FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation
摘要
视觉-语言-动作 (VLA) 模型在机器人操作方面取得了令人印象深刻的泛化能力,最近的记忆增强 VLA 通过对过去的图像或语言摘要进行调节,放松了马尔可夫假设。基于视觉的记忆方法通过对过去采样的图像帧进行调节来解决这个问题,但是当时间事件在视觉上不明确时(例如,以小动作多次按下按钮),它们的计算成本很高并且从根本上受到限制。我们提出了 FM-VLA,一种具有基于力的记忆的 VLA 模型,能够对非马尔可夫、接触丰富的操作进行时间上下文推理。我们使用通过力时间序列重建进行预训练的变分自动编码器(VAE)将力历史编码为紧凑的力记忆标记。通过将力潜在表示和短状态历史记录作为附加条件标记投射到动作专家模块,我们使 VLA 能够利用累积的接触事件历史记录来指导操作。我们在三个依赖于记忆的任务上评估 FM-VLA,包括找到隐藏的块、按下按钮和擦拭盘子特定次数。我们的轻量级力存储器以最小的推理开销实现了超过 80% 的成功率,显着优于基线方法。项目页面:https://qft-333.github.io/FM-VLA-Page/