记住你做了什么:行动历史记忆与双专家去噪,用于长期视觉-语言-行动策略
Remember What You Did: Action-History Memory with Dual-Expert Denoising for Long-Horizon Vision-Language-Action Policies
摘要
视觉-语言-动作(VLA)模型推动了机器人操作的快速进步,展示了强大的细粒度控制和在长期任务上的良好性能。然而,许多现有的 VLA 缺乏对交互历史的明确访问,使它们容易受到感知混叠的影响:不同任务阶段的相似当前观察和机器人状态可能会导致动作模糊性和较低的成功率。现有方法通过特征调节、动作先验修改或采样指导来结合时间或进度线索。然而,联合微调内存模块和基本 VLA 的方法会产生额外的策略训练成本,从而促使可训练的历史条件控制与冻结的基本策略细化分离。我们提出了 ActMem-VLA,这是一种双专家切换架构,它通过包含基于 Mamba 的内存模块和轻量级 PreAction Expert (PAE) 的内存插件来增强冻结的、微调的 VLA。具体来说,Mamba 将执行的操作历史记录编码到内存中,将 PAE 与当前上下文结合起来。通过这些输入,PAE 在早期高噪声去噪期间引导任务进展,然后将部分去噪的动作传递给冻结的动作专家 (AE),以在剩余的低噪声步骤期间细化动作细节。经过微调的基础 VLA 在整个训练过程中保持冻结状态,而只有 Mamba 模块和 PAE 进行联合优化。在 LIBERO-Mem 上,ActMem-VLA 在所有 10 项任务中实现了 80.8\% 的平均成功率,而 $π_{0.5}$ 为 65.2\%,MemoryVLA 为 49.5\%,同时仅引入了 3.45\% 的额外参数。在四个现实世界的任务中,它的平均成功率比 $π_{0.5}$ 提高了 28.8%。