论文
RoVLA:鲁棒视觉-语言-动作模型的多重一致性约束
RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型在具体操作方面表现出强大的性能,但在视觉观察变化、释义语言指令和复合扰动下仍然脆弱。这种限制表明现有方法仍然严重依赖于训练分布中的浅层相关性,而不是学习任务语义、环境状态和动作生成之间的稳定耦合。尽管最近的努力通过更大规模的训练、后训练 适应或增强的预测建模来提高鲁棒性,但它们很少在端到端策略本身中强制执行面向不变性的一致性。为了解决这个问题,我们提出了 RoVLA,一个具有多重一致性约束的强大的视觉-语言-动作框架。 RoVLA 在三个互补转换下强制执行一致性:指令语义、轨迹演化和观察扰动。具体来说,指令一致性(IC)促进语义等效指令重写下的稳定基础,进化一致性(EC)在整个生成过程中保留一致的动作意图,观察一致性(OC)通过在目标干扰之前和之后强制执行一致的预测来提高对视觉和本体感觉扰动的鲁棒性。通过在训练期间对这些不变性进行显式建模,RoVLA 减少了对表面相关性的依赖,并提高了鲁棒性和泛化性。 LIBERO-Plus、RoboTwin 2.0 和现实世界操作任务的实验表明,RoVLA 始终优于强大的基线方法,并在不同的任务和观察变化下表现出卓越的鲁棒性。这些结果证明了多重一致性学习对于鲁棒体现控制的有效性。代码可在 https://github.com/HCPLab-SYSU/RoVLA 获取。