论文

EvoScene-VLA:用于分块机器人控制的动作解码器内部不断演变的场景信念

EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control

摘要

分块视觉-语言-动作 (VLA) 策略根据一次观察生成多步骤动作,并且通常在执行动作块后重新观察。早期的操作会改变后续步骤的场景条件,而遮挡可能会损害视觉反馈。空间和时间 VLA 增强了几何形状和记忆,但随着动作改变对象姿势和接触,它们的表示可能会变得陈旧。我们引入了 EvoScene-VLA,它使用紧凑的场景标记来统一块内场景预测、跨块状态传播和基于观察的校正。动作专家在单个流程匹配过程中联合对动作和未来场景状态进行降噪,从而允许预测的场景变化通知动作生成。最终场景状态作为后续校正的下一个先验状态。在下一次控制调用时,视觉语言模型 (VLM) 将传入的视觉输入与先前的视觉输入融合。两级几何锚定将局部深度监督应用于每个视图的场景特征,将全局 3D 特征监督应用于融合场景状态;共享几何解码器对当前和未来状态施加相同的约束。由于演示不直接提供未来的场景状态,因此我们使用未来图像中的 3D 教师特征来训练场景预测器。它的预测为动作专家的未来场景状态提供了目标。在部署时,我们删除场景预测器和几何锚点。 EvoScene-VLA 在固定和随机设置下的 31 项 RoboTwin 任务上分别比匹配基线提高了 2.4 和 2.2 个百分点,在 LIBERO 上提高了 2.7 个百分点。在三项真实机器人任务中,平均成功率从 37.3% 上升至 42.0%。消融表明,单独的循环场景状态不一定会提高性能,而状态传播与几何和未来场景监督相结合可以改善控制。