论文
NebulaVLA:一种用于机器人操作的具有引导动作的双频视觉-语言-动作模型
NebulaVLA: A Dual-Frequency Vision-Language-Action Model With Guide Action for Robotic Manipulation
摘要
视觉-语言-动作 (VLA) 模型的实际部署通常会受到效率与性能权衡、跨机器人形态泛化和执行平滑性的瓶颈。我们提出了 NebulaVLA,一种异步双频架构,它将高层语义推理与底层动作控制解耦,优化计算资源和模块化。为了弥合异构机器人之间的语义差距,我们引入了 GESTURE-7,一种基于语言的统一动作表示。此外,我们的引导动作算法通过基于掩模的平滑度约束强制执行运动连续性。综合评估表明,NebulaVLA 显着优于同步基线,在 LIBERO-Plus 上实现了 85.5\% 的平均成功率,并将动作生成速度加快了 \textasciitilde 2.7$\times$。这种异步设计可为实际机器人技术提供高效且响应灵敏的控制。