论文
UniMPA:通过基于动作的转换建模建立统一的记忆-预测-动作模型
UniMPA: A Unified Memory-Prediction-Action Model via Action-Grounded Transition Modeling
摘要
视觉-语言-动作(VLA)模型的最新进展改进了机器人操作,但观察到动作的学习仍然受到基本的转换可实现性差距的限制,这体现在三个紧密耦合的问题上:(i)转换模糊性。视觉上相似的当前观察结果可能对应于不同的操纵阶段并意味着不同的后续转变。 (ii) 预测-执行不匹配。视觉上合理的预测未来观察不一定对应于物理上可实现的转变。 (iii) 经验-实现不匹配。历史上可执行的动作模式可能不一定实现当前场景中的预期转换,因此需要上下文感知的适应。因此,我们提出了 UniMPA,这是一种统一的内存-预测-动作模型,它通过共享的基于动作的转换接口来解决这些问题。 (i) UniMPA 引入持续选择性未来预测,通过对预期的未来状态演化进行建模来解决过渡模糊性。持久的潜在流持续跟踪任务级进度,而转换关键像素流通过基于内存的预测选择性地解决细粒度的交互变化。 (ii) 为了评估预期转换的物理可执行性,预测转换查询时间视觉动作记忆库。该银行检索历史上实现的视觉动作体验,将未来预测建立在可执行证据的基础上。 (iii) 为了使可执行体验适应当前场景,动作视觉记忆库从历史动作演变中检索基于视觉的动作原型。然后,原型偏置流将流源转向历史支持的动作流形,以实现上下文感知的细化。