论文
RIFAR:持续机器人学习的可靠性与遗忘感知回放
RIFAR: Reliability and Forgetting-Aware Replay for Continual Robot Learning
摘要
真正的具身智能要求机器人把连续的真实世界经验转化为持久、可迁移的技能。这需要持续学习:随任务与环境演化整合新能力而不侵蚀既有知识。经验回放缓解遗忘,但随任务积累存储完整演示代价高。世界动作模型提供生成式替代——通过动作与未来观测的联合预测重建过去经验。但视觉连贯的rollout可能包含无法实现所预测转移的动作,且新任务适应会扰动已学行为。为此RIFAR结合可靠性筛查与漂移感知回放选择:从紧凑演示前缀重建轨迹,用冻结逆动力学模型评估动作-视觉一致性;训练先把当前演示与最高质量的已筛轨迹结合;随后在相同历史输入上比较适配前后的动作预测,从同一已筛池重选归一化漂移更大的轨迹继续训练。跨三个LIBERO套件与真机实验,RIFAR超越基于WAM的生成式回放的先前SOTA:LIBERO-Goal达90.97 AUC,同时每任务仅保留320个历史时间步——约为50演示回放保留步数的4.9%。