论文
超越词元重要性:保留空间支架以实现高效的视觉-语言-动作推理
Beyond Token Importance: Preserving Spatial Scaffolds for Efficient Vision-Language-Action Inference
摘要
现有的 VLA 修剪策略主要根据任务级语义相关性选择单个视觉标记,而忽略了机器人操作所需的空间信息。为了检查这个限制,我们构建了一个简单的 Stride 基线,它沿着扁平的一维视觉序列均匀地采样标记,代表纯粹的几何修剪策略。令人惊讶的是,Stride 在某些修剪比率下优于语义修剪和随机修剪,但当词元预算仅略微减少时就会崩溃。我们通过空间覆盖半径来表征这种现象,空间覆盖半径定义为剪枝后保留的词元集引起的最大空间盲点。我们的分析揭示了保留标记的空间结构与任务成功之间存在很强的相关性,这表明可靠的 VLA 修剪不仅需要保留与任务相关的标记,还需要保留场景的空间支架。受此诊断的启发,我们提出了 GeoScaffold,这是一种免训练的视觉词元修剪方法,它将每个图像划分为空间区域,使用任务相关权重分配区域间词元预算,并通过最远点采样选择区域内脚手架词元以减少局部覆盖半径。在 pi 0.5 和 LIBERO 上,GeoScaffold 仅保留 20% 的视觉标记,同时保留 93.2% 的平均成功率,并且与未修剪的基线相比,预填充速度提高了 1.78 倍。