论文
PearlVLA:潜在空间中渐进的具体行动计划细化
PearlVLA: Progressive Embodied Action-Plan Refinement in Latent Space
摘要
当前的视觉-语言-行动(VLA)模型面临着高效行动生成和明确审议之间的权衡。直接解码来自视觉语言主干表示的动作可以实现低延迟控制,而通过文本链、像素级子目标或动作搜索进行显式推理可以改进规划,但会产生大量延迟和计算成本。我们提出了 PearlVLA,这是一个 VLA 框架,可将审议转移到视觉语言模型 (VLM) 的潜在空间。 PearlVLA 将 VLM 元查询表示分离为固定视觉定位分支和迭代潜在计划分支。在每一轮细化中,计划条件的世界查询都会探测轻量级的冻结潜在世界模型,以实现无动作的未来观测潜在表示,并将其反馈以指导计划细化。然后,面向未来的 RefineNet 应用预定的残差更新,逐步将粗略的语义草案细化为细粒度的潜在行动计划。 K 轮后的细化计划随后被并行解码为动作块,以实现低延迟执行。我们进一步引入因果细化-分组过程-奖励强化学习,以通过潜在计划编辑引起的更长期想象的未来的奖励来优化潜在细化过程。对 LIBERO 基准的实证评估表明,PearlVLA 在现有方法中实现了最先进的性能。