论文
ReactVLA:通过改进的平均流动作生成实现快速、轻量级的反应式机器人操作
ReactVLA: Fast and Lightweight Reactive Robot Manipulation via Improved Mean Flow Action Generation
摘要
基于扩散的视觉-语言-动作(VLA)策略在表达性和多模式动作分布建模方面表现出了强大的能力。然而,它们对迭代采样的依赖引入了相当大的推理延迟,这限制了它们在反应式闭环机器人操作中的适用性。为了解决这个限制,我们提出了 \texttt{ReactVLA},一个用于实时机器人操作的轻量级、低延迟的 VLA 框架。 ReactVLA 结合了两种互补的设计:(1)改进的平均流(iMF)动作生成器,可将昂贵的多步扩散采样减少为一步到几步的动作生成;(2)注意力残差(AttnRes),一种动态深度特征路由机制,取代均匀残差累积,以更好地保留与任务相关的多模态表示。我们在大规模模拟基准(包括 LIBERO 和 RoboIMI)以及现实世界的机器人操作任务上评估 \texttt{ReactVLA}。实验结果表明,\texttt{ReactVLA} 始终优于类似大小的 VLA 基线,包括 SmolVLA 和 $π_0$。在具有挑战性的精确操作任务中,与领先的 VLA 模型相比,\texttt{ReactVLA} 的任务性能提高了 1.65$\times$,同时推理速度提高了 4$\times$ 以上。最后,它将现实世界的策略延迟减少到 38.6 毫秒以下,从而在物理机器人平台上实现快速反应控制。请查看我们的项目网站:https://game-loader.github.io/ReactVLA/。