论文

无需训练 交互对齐的视觉标记修剪,用于高效的具身操作

Training-Free Interaction-Aligned Visual Token Pruning for Efficient Embodied Manipulation

模型推理推理加速

摘要

高效的视觉表示是具身操作中的一个核心图像处理挑战,其中策略在闭环控制期间重复处理密集的视觉标记序列。现有方法使用语义相关性、VLM 注意力、跨帧冗余或动作空间中的运动对标记进行排序或修剪。当与指令相关的外观和观察到的图像运动尚未在空间上对齐时,这些信号可能会丢弃与任务相关的区域。我们引入了交互对齐修剪(IAprune),这是一种 无需训练 方法,它将每帧预算设置和预算内词元选择视为两个相关决策。语义-运动空间一致性指导保守覆盖和激进覆盖之间的选择,并将所得区域大小映射到校准的动态预算。连续的语义和运动响应对现有标记进行排序,而几何残差校正将固定选择槽重定向到代表性不足的边界,而不增加序列长度。在四个具体的操纵策略、三个模拟基准和一个真实的机器人平台上,IAprune 提供了有利的精度-效率权衡,将 LIBERO 上的未剪枝策略与 1.54 倍的加速相匹配,并在真实机器人上达到了 1.48 倍的加速。分阶段分析表明,在情节早期紧张的预算下,保留收益最大,而固定预算分析证实,几何结构用边界和接触区域证据取代低优先级标记,而不是保留更多标记。我们的项目网站是:\href{https://hengjt1999.github.io/VLA-IAP.github.io/}{IAprune.com}。