论文
FAN:用于视觉-语言-动作模型持续适应的预见动作标准化
FAN: Foresight Action Normalization for Continual Adaptation of Vision-Language-Action Models
摘要
在大规模封闭数据集上预训练的视觉-语言-动作 (VLA) 模型在各种机器人操作任务中取得了显着的成功。然而,它们的长期现实部署需要不断获取新技能,同时保留以前学到的能力。虽然开创性工作使用经验回放和强化微调等技术探索了持续的 VLA 适应,但它们忽略了一个基本机制:动作规范化,它决定了策略感知和执行物理动作的底层坐标系。为了弥补这一差距,我们系统地评估了涉及单臂和双手操作的四个现实世界任务流的五种标准化策略。我们的分析表明,由于任务间坐标漂移、有限的运动覆盖范围或训练测试坐标不匹配,现有协议会导致严重的故障模式。在这些见解的推动下,我们制定了三个核心设计原则:一致性、覆盖率和因果关系(3C),并引入前瞻行动规范化(FAN)。 FAN 在持续学习之前从一个小的、独立于任务的校准集中估计归一化统计数据,并在整个适应过程中冻结它们。在所有评估的流中,FAN 实现了最高的性能并表现出一致的鲁棒性,为构建稳定的动作表示以实现有效的终身 VLA 适应提供了富有洞察力的指导。