论文
TFP:用于视觉运动学习的时间条件记忆融合策略
TFP: Temporally Conditioned Memory-Fusion Policies for Visuomotor Learning
摘要
视觉-语言-动作 (VLA) 策略(例如 $π_{0.5}$ 和 OpenVLA)在许多操作任务上表现良好,但它们通常是反应性的:下一个动作是根据当前的观察、指令和本体感受状态来预测的。这种假设在依赖于阶段的操作中被打破,其中视觉上相似的状态可能需要不同的操作,具体取决于潜在任务进度和先前的交互结果。我们认为,此类任务不仅需要记忆,还需要动态感知的信念更新:策略应该在稳定或闭塞阶段保留任务进度,并在接触、释放或子目标转换附近修改其信念。我们引入了临时条件内存融合策略(TFP),这是一种用于 VLA 主干的轻量级内存操作框架。 TFP 通过液体时间常数动力学维持事件局部任务进展信念,并通过自适应调制将更新的信念直接注入流匹配动作解码器。这让暂时积累的上下文塑造生成的动作块,而不是仅充当被动的历史上下文。通过 3.3B 参数模型,TFP 将 LIBERO 的平均成功率从 96.9% 提高到 98.75%,将 LIBERO-plus 的平均成功率从 91.4% 提高到 93.77%。在以内存为中心的 MIKASA ShellGameTouch 诊断中,TFP 的成功率高达 75.0%。机制分析表明,操作事件附近的写入增益变化大约是远非事件阶段的 6 倍,而隐藏状态干预表明,信念因果地调节了生成的动作块。这些结果表明,紧凑、事件敏感的记忆动态可以改善遮挡、视觉扰动和阶段相关任务结构下的 VLA 策略。