论文
ComVLA:6G 连接机器人中 VLA 模型的通信感知分割推理
ComVLA: Communication-Aware Split Inference for VLA Models in 6G-Connected Robotics
摘要
互联机器人技术是一种新兴的 6G 应用,其中移动机器人遵循自然语言指令来操纵物理对象。实现这一点的视觉-语言-动作(VLA)模型太大,无法在机器人上运行;一个常见的趋势是将推理转移到云端。然而,无线链路限制了边缘每个控制步骤可以传输的传感数据量。最近的两条线路解决了这一限制:语义通信编解码器压缩传感器数据但需要特定于通道的重新训练,VLA 词元修剪器从图像中选择词元但忽略通道。我们的见解是,语言中包含的密集语义信息已经表明哪些视觉标记很重要。我们提出了 ComVLA,一个使用这种语言指导来使 VLA 词元预算 适应信道容量的框架。在 LIBERO 基准上传输 32 个词元,而不是 512 个,与原始 OpenVLA-OFT 基准相比,ComVLA 将推理计算量减少了 74%,推理延迟减少了 22%,平均任务成功成本为 1.5 个百分点(95.4% 对 96.9%),并且在瑞利和莱斯衰落下保持在容量预算范围内。这些结果表明,共同设计 VLA 推理和无线通信是 6G 连接机器人技术的实用方向。