论文
SAFE-Pruner:语义注意力引导的未来感知词元修剪,用于高效的视觉-语言-动作操作
SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation
摘要
视觉-语言-动作(VLA)模型的实时推理对于机器人控制至关重要。虽然视觉标记修剪显示出加速推理的强大潜力,但大多数现有方法主要基于浅层线索进行修剪决策,并且存在丢弃深层所需视觉信息的风险。为了解决这个问题,我们提出了 SAFE-Pruner,这是一种即插即用的剪枝框架,它将未来层的注意力线索纳入剪枝决策中。具体来说,我们识别了语义注意力一致性,即 VLA 模型将注意力概率质量集中在控制时间步长上的同一语义实体上的趋势。基于这一观察,我们设计了一种前瞻性策略来预测深层的词元显着性,这可以防止过早删除关键词元并导致更稳定的加速。我们进一步引入了参考时间步长刷新策略,该策略在注意力转移时触发更新,从而提高预测准确性和修剪可靠性。跨不同评估设置的大量实验表明,我们的方法实现了高达 1.89 倍的加速,成功率下降最小化不到 1.5%,同时优于最先进的方法高达 1.9%。