论文
PHASER:视觉-语言-动作模型的阶段感知和语义体验重放
PHASER: Phase-Aware and Semantic Experience Replay for Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型在语言条件机器人操作方面取得了显着的成功。然而,在开放式环境中部署这些模型需要不断获得新技能,这个过程不可避免地会引发对先前学到的行为的严重灾难性遗忘。虽然经验重放(ER)是一种标准的缓解策略,但朴素的均匀采样从根本上与操纵轨迹的时间特征不相符。它系统地对简短但因果关系关键的子技能进行了抽样不足,导致阶段饥饿,并且完全忽视了历史任务中不同程度的遗忘。为了克服这些限制,我们引入了 PHASER,一种与架构无关的持续学习框架。 PHASER 采用以阶段为中心的容量分配,保证对所有子技能的同等内存支持,并结合多模式干扰路由策略,动态优先考虑高遗忘风险的历史阶段。此外,为了实现完全自主的终身适应,我们集成了 Auto-PC,这是一种轻量级管道,将无监督动作信号变化点检测与基于 VLM 的语义验证相结合,无需密集的手动监督即可提取时间边界。通过对 LIBERO 持续学习套件上的三个 VLA 主干进行评估,PHASER 产生了实质性的实证改进,与匹配预算 ER 相比,平均成功率 (ASR) 提高了高达 31%,并在 LIBERO-Goal CL 设置上实现了 87.8% 的最终 ASR。