论文

通过紧急表征专业化的延迟容忍云边缘协作视觉-语言-动作模型

Latency-Tolerant Cloud-Edge Collaborative Vision-Language-Action Models via Emergent Representational Specialization

模型训练监督微调与指令调优

摘要

在移动机器人上部署数十亿参数的视觉-语言-动作 (VLA) 策略会产生系统冲突:语义推理受益于云 GPU,而闭环控制必须在本地响应,尽管存在网络延迟和抖动。现有的分层和异步策略提高了吞吐量,但它们的慢速路径表示仍然可能过时或需要显式调度和延迟提示。我们引入了 CloudEdgeVLA,这是一种将时间错位视为表示学习问题的云边缘策略。云 VLA 将延迟观察编码为缓慢变化的任务特征,而轻量级边缘头将最新可用的云特征与当前本地视觉相结合。在训练期间,当前帧和随机延迟帧与新鲜路径和陈旧路径中的相同当前动作目标配对。这一目标鼓励云表示保留任务级信息,同时边缘路径提供状态敏感的校正,从而推动紧急专业化。在四个 LIBERO 套件中,CloudEdgeVLA 在 40 步均匀延迟窗口下保持了 63.8-78.0% 的成功率,而 VLASH 最多达到 6.4%,评估的单路径基线最多为 3.0%。通过消除控制环路中的阻塞同步,该设计提供了一条可扩展 VLA 部署的实用途径,其中云模型可以增长,而边缘计算保持轻量级和响应性。