论文
GloVLA:让几何体移动和局部 VLA 交互,在非结构化环境中实现稳健的以对象为中心的操作
GloVLA: Let Geometry Move and Local VLA Interact for Robust Object-Centric Manipulation in Unstructured Environments
摘要
视觉-语言-动作(VLA)模型已经显示出对语言条件机器人操作有希望的泛化能力,但将它们部署在非结构化环境中仍然具有挑战性。单一的端到端 VLA 策略必须同时解决末端执行器到任务相关区域的长距离运输以及到达后的短视界、接触丰富的交互。这种表述效率低下且脆弱:微小的视觉变化、干扰物、混乱、遮挡或不利的初始抓手姿势可能会将策略推到其接受训练的当地状态分布之外,从而导致任务失败。我们引入了 GloVLA,一个混合框架,它明确地将以对象为中心的操作分为两个互补的机制:几何传输控制器将末端执行器移动到以交互为中心的切换区域,而本地 VLA 策略仅处理短时域交互阶段。 GloVLA 与模型无关,可以与不同的 VLA 主干集成,无需额外演示,也无需更改操作空间或成功谓词。标准 LIBERO 和 LIBERO-Plus 对象任务的实验以及新引入的 LIBERO-Challenge 基准测试(包括杂乱、干扰物、照明变化、视觉偏移和障碍物)表明,与完整的端到端挑战、全轨迹 GR00T N1.6 执行相比,GloVLA 提高了任务成功率并大幅降低了 VLA 推理成本,而 GloVLA 的平均成功率下降至 20.9%保留88.5%;在物理 UR10e 上,总体成功率从 35.6% 提高到 90.0%,同时平均推理时间减少一半以上。视频和其他结果可在 https://glovla-project.github.io/ 获取