论文
DSDyn-VLA:具有运动感知、未来感知和实时校正的双流动态操纵框架
DSDyn-VLA: A Dual-Stream Dynamic Manipulation Framework with Motion Perception, Future Awareness, and Realtime Correction
摘要
虽然视觉-语言-动作 (VLA) 模型在静态任务中表现出色,但它们在物体运动的动态环境中表现不佳(例如传送带操作)。我们确定了在这些场景中阻碍当前 VLA 的三个基本限制: 感知差距,其中静态视觉输入缺乏时间运动线索; 延迟间隙,其中推理延迟导致操作过时;以及控制间隙,由开环动作块执行而没有实时调整引起的。在这项工作中,我们提出了 DSDyn-VLA,一种慢速Dual-Stream Dynamic 操纵框架,它将运动感知预见性规划与实时残差校正相结合。缓慢的 Flow-Planner 充当宏观规划器。通过使用用于时间感知的光流和未来状态感知机制来增强 VLA,以先发制人地抵消推理延迟,它可以生成全局一致的运动感知动作块。作为补充,快速 Res-Refiner 采用轻量级 RL 策略,根据实时观察将高频闭环校正注入计划的动作块中。此外,我们还引入了 DynBench,这是一个基于 MuJoCo 的动态对象操作基准,包含九个任务。大量实验表明,在 Kinetix 动态基准测试中,在高延迟设置下,DSDyn-VLA 与当前的 SOTA 方法相比,故障率降低了 76% 以上,同时在实际动态设置中实现了 PI0.5 成功率的约 6 倍,在 DynBench 上实现了约 5 倍。我们将开源所有代码和权重。