论文
用于高效视觉-语言-操作策略的角色条件子词元路由
Role-Conditioned Sub-Token Routing for Efficient Vision-Language-Action Policies
摘要
视觉-语言-动作 (VLA) 模型处理长的多模态标记序列,使得推理在内存和计算方面都非常昂贵。现有的效率方法主要减少视觉标记,但激进的标记修剪变得脆弱,因为删除标记会丢弃其整个表示。子词元压缩通过保留更多词元同时减少其值宽度来提供补充替代方案。然而,直接将子词元压缩应用于 VLA 策略的效果较差,因为对于感知、语言理解和控制重要的信息在多模态表示中分布不同。我们引入角色条件子词元路由(RoleSub),它学习如何压缩保留词元的值表示。在视觉词元缩减之后,RoleSub 将每个保留值表示划分为正交空间中的组,并使用轻量级路由器来确定应保留哪些组。路由决策以词元表示、学习的潜在角色表示和语言上下文为条件。相同的机制也可以应用于语言值,允许压缩视觉和语言表示而不删除额外的标记。我们在 OpenVLA-OFT-7B 上跨四个 LIBERO 套件评估 RoleSub。在匹配的视觉 KV 预算下,RoleSub 在 36 种设置中的 33 种中优于经过训练的仅词元控制,在积极压缩下收益最大。结合视觉和语言压缩将总 KV 减少到原始的 9.2--11.3%,同时在大多数任务上保持强大的控制性能。这些结果表明,减少保留词元中的表示为激进的 VLA 压缩的词元修剪提供了有效的补充。