论文
视觉-语言-动作模型中用于长期规划的显式语言记忆
Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型为连接视觉感知、语言理解和机器人控制提供了统一的范式。然而,现有的 VLA 模型在长期任务中仍然面临重大挑战:稀疏的专家演示限制了跨任务组合泛化;长期任务的非马尔可夫性质使得仅以当前观察为条件的政策很难保持时间一致性;有限的闭环纠错允许执行错误累积;端到端动作 微调 可能会削弱视觉语言模型(VLM)主干的高级语义表示。为了解决这些问题,我们提出了一种具有显式语言记忆模块的分层长视野 VLA 架构。其中心思想是将离散的时间观察转化为具有时间逻辑的连贯的文本记忆序列。该系统被解耦为高层VLM和低层VLA:高层VLM通过视觉问答训练范例进行语义推理,而低层VLA则根据子任务指令和视觉观察执行精确的连续控制。高级 VLM 使用先前的内存作为上下文锚来递归更新语言内存和子任务指令,从而在长范围执行期间实现持久的时间跟踪和动态校正。我们在多个仿真环境中评估所提出的方法,并在真实的机器人平台上进行模拟到真实的实验。结果表明,显式语言记忆提高了 VLA 模型在复杂的长期任务上的成功率和鲁棒性,同时提供了决策过程的可解释的语义解释。