论文

重构和细化视觉-语言-动作模型的潜在推理流程

Recompose and Refine Latent Reasoning Flows for Vision-Language-Action Models

摘要

潜在推理使视觉语言动作(VLA)模型能够在生成连续的机器人动作之前将多模态观察转换为与任务相关的内部状态。虽然现有方法学习为每个策略查询生成或细化此类状态,但它们在执行后丢弃成功的推理,因此从头开始重建类似的计算。我们提出了推理和流内存(FLOWMEM),这是一种统一的 VLA 模型,可将成功的潜在计算转化为可重用的推理体验。 FLOWMEM 不是附加固定的检索上下文,而是随着具体上下文的发展动态检索和重组兼容的潜在片段,形成遵循时间结构和成功计算进度的推理路线。然后,在影响动作生成之前,使用当前的视觉和本体感受证据来完善该路线。 RoboMME 和 LIBERO-Plus 上的实验表明,FLOWMEM 取得了 48.0% 和 77.3% 的成功率,分别比无内存策略高出 1.7 和 4.1 个百分点。这些结果证明了价值 重用闭环 VLA 控制的成功潜在计算。