论文

VLA-Corrector:自适应行动视野的轻量级检测和纠正推理

VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon

模型推理推理验证与自校正

摘要

视觉-语言-动作(VLA)基础模型最近在具身智能方面取得了巨大进展。为了在保持时间一致性的同时降低策略调用频率,大多数生成策略采用动作块机制,在固定的动作范围内以开环方式执行多个未来动作。然而,这种“预测然后盲目执行”的范式牺牲了闭环反应性:在接触丰富的物理交互中,即使是很小的局部扰动也会在开环盲点内迅速放大,导致复合错误并最终导致任务失败。为了解决这一限制,我们提出了 VLA-Corrector,这是一种用于动作分块 VLA 策略的轻量级校正推理框架。在不修改主干策略权重的情况下,VLA-Corrector 引入了一种轻量级的潜在空间视觉监视器(LVM),它不断比较预测和实际的视觉特征演化,从而实现视觉动态偏差的在线检测。一旦检测到持续偏差,系统就会触发截断事件,丢弃剩余的过时操作,并通过在线梯度指导(OGG)调用纠正性重新计划。 VLA-Corrector 的检测和纠正机制自然会引发事件触发的自适应行动范围:当当前块保持可靠时,它保留长期执行,并在执行开始漂移时调用短期纠正重新规划。通过这样做,VLA-Corrector 减轻了执行鲁棒性和策略调用频率之间静态范围所带来的权衡。它可以集成到不同的 VLA 模型中,而无需进一步重新训练 VLA 主干,中断复合错误,同时保留动作分块的大部分效率优势,并显着提高长视野、接触丰富的机器人操作任务的鲁棒性。