论文
$μ$VLA:论 VLA 模型中部分可观察操作的循环记忆
$μ$VLA: On Recurrent Memory for Partially Observable Manipulation in VLA Models
摘要
视觉-语言-动作(VLA)模型根据当前的观察来预测未来的动作块,这种假设在部分可观察性下失败,因为决策依赖于不再可见的信息。现有的记忆增强 VLA 同时引入了递归、检索、压缩模块、辅助目标、分层内存或特定于任务的架构更改,因此递归本身的贡献仍然与周围的机器纠缠在一起。我们提出了一项针对强预训练 VLA 主干中复发的受控隔离研究。我们的公式通过一小组跨时间步长的可学习记忆标记来增强 Transformer,并通过自注意力进行更新,通过随时间截断的反向传播进行端到端训练,没有辅助损失,也没有架构变化。我们将其实例化为 $μ$VLA,这是一系列由内存宽度 m、TBPTT 长度 K 和内存更新规则(跨步梯度或分离 EMA)参数化的 OpenVLA-OFT 变体,因此重复是唯一的变化因素。在 MIKASA-Robo 上,$μ$VLA 在最强设置下将五项训练任务的平均成功率从 0.42 提高到 0.84,并且在具有相同记忆结构的保留任务上达到 0.23,而无记忆基线为 0.07。在需要不同内存结构的任务上,性能仍接近基线。在 LIBERO 上,最强的复发变体达到了 96.2% 的平均成功率,表明在完全可观察的情况下没有回归。我们将这些结果解释为对最小主干循环的能力包络的校准,确定其足够的状态以及需要额外存储结构的状态。演示和视频可以在 https://avanturist322.github.io/mu-vla/ 中找到。