论文
克服动力学盲目性:VLA 模型的 无需训练 步速和路径校正
Overcoming Dynamics-Blindness: Training-Free Pace-and-Path Correction for VLA Models
摘要
视觉-语言-动作(VLA)模型实现了超越经典控制范式的卓越灵活性和泛化性。然而,大多数流行的 VLA 都是在单帧观察范式下进行训练的,这使得它们在结构上对时间动态视而不见。因此,即使在动态数据集上进行训练或微调,这些模型在非平稳场景中也会严重退化。现有的方法要么需要昂贵的重新训练,要么遭受延迟瓶颈和动作块之间的时间一致性差的问题。我们提出了 Pace-and-Path Correction,这是一种 无需训练,封闭式推理时间运算符,可包装任何分块动作 VLA。从单个二次成本中,联合最小化产生了一个统一的解决方案,该解决方案正交地分解为两个不同的通道。步速通道沿计划方向压缩执行,而路径通道应用正交空间偏移,共同吸收块窗口内的感知动态。我们在综合诊断基准 MoveBench 上评估我们的方法,该基准旨在将运动隔离为唯一的控制变量。实证结果表明,我们的框架始终优于最先进的 无需训练 包装器和动态自适应方法,并且在纯动态和静态-动态混合环境中,与基础 VLA 模型相比,绝对成功率分别提高了 28.8% 和 25.9%。