论文

视觉-语言-动作模型的学习图像压缩

Learned Image Compression for Vision-Language-Action Models

AI 基础设施数据基础设施

摘要

视觉-语言-动作(VLA)模型越来越依赖高频多摄像头观察,使得视觉通信成为带宽受限或分布式部署设置中实时机器人控制的主要瓶颈。然而,现有的图像和视频编解码器旨在保留通用视觉保真度,而不是下游 VLA 策略的控制性能。在这项工作中,我们引入了 SPARC(空间自适应速率控制),这是一种为 VLA 驱动的机器人量身定制的学习图像压缩框架。我们的主要观察结果是,视觉信息的重要性在相机视图和图像内的空间区域之间存在很大差异。基于这一观察,SPARC 采用了一种轻量级时间掩码选择器,可以根据任务相关性在潜在表示上自适应地分配比特率,同时利用时间上下文。我们进一步引入了倾斜率损失,通过减少基于熵的目标过度抑制罕见但任务关键的视觉模式的趋势来稳定训练。对各种机器人基准测试(包括 RoboCasa365、VLABench 和 LIBERO)的实验表明,在相同的比特率预算下,SPARC 始终比传统图像/视频编解码器和最近学习的压缩方法实现更强的控制性能。我们还展示了远程控制设置中的实际部署优势,我们的方法大大改善了比特率与成功的权衡。