论文
何时修剪、修剪什么?用于高效VLA的阶段感知视觉token修剪
When and What to Prune? Stage-Aware Visual Token Pruning for Efficient VLA
摘要
视觉token剪枝是加速视觉语言模型的有效方法,对于视觉语言动作 (VLA) 推理特别有用,在预测机器人动作之前必须处理许多视觉token。现有的剪枝方法通常根据注意力分数或特征多样性来估计哪些token可以被剪枝,保留高度关注或在视觉上与其他人不同的token。然而,它们大多数使用固定的剪枝方案,例如在预设层剪枝一次或在均匀间隔的层剪枝。这样的时间表对于VLA模型来说可能存在风险,因为模型可能不知道哪些视觉区域对于早期层的动作很重要。 token乍一看不重要,但在模型将视觉观察与语言指令结合起来后可能会变得有用。在这项工作中,我们提出了 SAPrune,一种用于高效VLA推理的无需训练可视化token修剪框架。 SAPrune 不是在固定层进行剪枝,而是使用一个小的校准集来观察动作到视觉注意力如何跨层变化,并且仅在注意力模式变得更加可靠后才选择剪枝层。在每个选定的层,SAPrune 应用双路径修剪规则:一条路径保护强烈关注的视觉token免受修剪,而另一条路径则防止丢弃有用的周围上下文。对 LIBERO、SIMPLER 和现实世界机器人任务的实验表明,SAPrune 修剪了 87.5% 的视觉token,并实现了高达 1.718 倍的推理加速,同时保持了具有竞争力的任务成功率速率。
