论文

WA-SpecDec:用于视觉-语言-动作模型的世界感知 推测解码

WA-SpecDec: World-Aware Speculative Decoding for Vision-Language-Action Models

模型推理投机采样

摘要

视觉-语言-动作 (VLA) 策略以自回归方式生成机器人控制,从而使闭环延迟由重复的目标模型前向传递主导。 推测解码 通过并行验证草案操作词元块来降低此成本,并且最近的 VLA 方法进一步放宽了 词元级 的接受度,因为操作词元空间中的微小差异通常映射到类似的连续控制。然而,这种放松仍然与场景无关。固定的词元距离容差将相同的动作词元偏差视为在不同状态下同样安全,尽管在自由空间中无害的偏差可能会导致碰撞或接近接触时的抓取失败。我们提出 WA-SpecDec,一个世界感知的 推测解码 框架,在 VLA 预填充阶段注入世界模型衍生的物理场景感知,为提案草案和目标验证生成共享的世界感知预填充状态,而不改变宽松的接受规则。在三种最先进的宽松接受方案中,WA-SpecDec 在更宽松的放松下保持了更高的任务成功率,并支持更长的接受前缀。在可比较的成功操作点上,WA-SpecDec 比单独的 VLA 推测解码 实现了 1.5 倍的匹配成功加速,并且相对于相应的推测基线,近接触故障 (NCF) 平均减少了 18.6%。