论文

PhysVLA:面向实体机器人操作的物理符合物理规律的 VLA

PhysVLA: Towards Physically-Grounded VLA for Embodied Robotic Manipulation

模型推理推理验证与自校正

摘要

视觉-语言-动作 (VLA) 模型擅长将视觉输入和自然语言指令直接映射到机器人控制策略。然而,由于它们主要接受训练以适应行为演示数据,因此它们没有明确执行基本物理原理,例如刚体动力学或接触约束。这暴露了一个关键的物理差距:在单步或分块 VLA 之上应用的标准时间平滑会牺牲轨迹质量,从而增加短期记忆无法解决的故障。为了弥补这一差距,我们引入了 PhysVLA (Physics-VLA),这是一种即插即用的推理时间框架,旨在包装任何冻结的 VLA 主干,无需重新训练、微调 或权重访问,每个控制步骤的开销不到 1 毫秒。 PhysVLA 拦截预测的控制动作,仅捕获模拟器或系统状态,并应用双层校正:(i) 构建离散任务段(接近、抓取、运输和放置)的相位感知有限状态机,以及 (ii) 仅当动力学预言机检测到运动动力学不一致时才激活的选择性欧拉-拉格朗日门。该框架使用 7 自由度 Franka Panda 对 LIBERO-Spatial 上的 OpenVLA、OpenVLA-OFT、Force-VLA 和 Generalist-VLA 进行了评估,绝对成功率提高了 17%,稳定性提高了 19%,且没有每任务回归,所有四个骨干网的轨迹效率提高了 15%,Robosuite Lift 上的轨迹加加速度鲁棒性提高了 10 倍跨模拟器扫描。我们通过拾放任务在真实的 Agilex Piper 手臂上进一步验证了该框架,确认 PhysVLA 无需重新训练即可转移到物理硬件,成功率提高高达 50%,将物理感知建立为可组合、与主干无关的运行时模块。