论文
VLA-ACL:以动作一致性监督视觉词元剪枝
VLA-ACL: Action-Consistent Visual Token Pruning for Efficient Vision-Language-Action Models
摘要
视觉-语言-动作 (VLA) 模型实现了强大的机器人操作性能,但在每个控制步骤处理长 token 序列会产生高昂的计算成本,从而限制了实时部署。视觉 token 剪枝提供了直接的解决方案,因为视觉补丁在输入序列中占主导地位并包含相当多的冗余。然而,现有方法要么依赖于间接的 无需训练启发法,例如注意力分数和运动阈值,要么需要昂贵的基本 VLA 模型的微调。我们引入了 VLA-ACL(动作一致性学习),它通过动作级监督学习轻量级视觉 token 修剪策略,同时保持基本 VLA 模型完全冻结。 训练目标鼓励从修剪的视觉上下文中产生的动作与全上下文 教师模型 保持一致,并以真实动作作为辅助监督。这直接将 token 选择与其对下游控制输出的影响联系起来。在 LIBERO 和现实操作任务上的实验表明,VLA-ACL 在保持竞争性能的同时,对视觉 token 进行了高达 87.5% 的修剪,计算量减少了高达 75%,并实现了 1.5 倍的推理加速。这些结果建立了比现有的 freeze-VLA 修剪方法更强的性能-效率权衡,并证明了视觉 token 选择的动作级监督的价值。代码可在 https://github.com/du-owen/VLA-ACL. 获取
