论文

PaCo-VLA:用于接触丰富的视觉-语言-动作操纵的无源屏蔽合规性先验

PaCo-VLA: Passivity-Shielded Compliance Prior for Contact-Rich Vision-Language-Action Manipulation

摘要

丰富的接触操作需要高级语义推理和高频接触动态的安全调节。虽然视觉-语言-动作 (VLA) 模型提供了前所未有的语义概括,但其低速率输出缺乏力敏感任务中直接工厂权限所需的可靠性。为了弥合语义与控制之间的差距,我们引入了 PaCo-VLA,这是一种重新设计 VLA 接口的被动屏蔽合规性先验。 PaCo-VLA 并不信任具有直接运动命令的 VLA,而是将网络输出视为任务级合规性建议:语义绑定、任务阶段和准入计划。高频、独立于提案的被动屏蔽通过能量罐核算和边界检查来管理这些提案,防止无效、过时或未经验证的模型预测绕过低级接触物理。这种解耦的架构还可以进行因果评估,将语义贡献与几何捷径隔离开来。大量的模拟和真实连接器插入实验表明,PaCo-VLA 比非屏蔽 VLA 基线具有更高的精度,即使在对抗性顺从性变化的情况下也能保持零无源违规。该框架在准入端口建立了可证明采样的被动运行时契约,并提供了用于在接触丰富的域中部署基础模型的运行时接口。