论文
递归信念视觉语言模型
Recursive Belief Vision Language Model
摘要
当前的视觉-语言-动作(VLA)模型在部分可观察性下难以进行长视野操作。大多数现有方法仍然是观察驱动的,依赖于短上下文窗口或对视觉语言模型(VLM)的重复查询。这会导致任务进度丢失、感知混叠下的动作重复以及高推理延迟。语义推理本身并不是长视野操作的主要瓶颈。相反,VLA 缺乏持久的、以动作为条件的状态表示,并且表现出有限的时间和物理推理,这使得它们不适合多阶段控制。本文介绍了 RB-VLA,这是一种以信念为中心的架构,通过自我监督的世界模型目标进行训练,保持紧凑的潜在状态编码任务相关的历史、动态和对象交互。查询一次高层意图后,VLM 提供任务规范,而信念则跟踪任务进度,并在部分可观察性下实现阶段感知、因果基础控制,而无需存储原始观察结果或随时间扩展内存。信念和意图共同决定了稳健闭环执行的扩散策略。 RB-VLA 在长视野基准测试中优于之前的 VLA,与 {\pi}0 相比,在多级拾放和堆叠任务上的成功率分别高出 52.5% 和 37.5%。相对于基线,它还可以将推理延迟减少多达 5 倍,并消除现有 VLA 中观察到的跨时间步长的内存增长。消融表明信念模块是绩效的主要驱动力,将成功率从 32.5% 提高到 77.5%。这些结果证明了基于信仰的国家代表对于长期 VLA 政策的有效性。
