论文

ShieldVLA:视觉-语言-动作模型的可行性感知安全调整

ShieldVLA: Feasibility-Aware Safety Alignment for Vision-Language-Action Models

模型训练强化学习

摘要

视觉-语言-动作(VLA)模型在机器人操作和导航方面表现出很强的通用性,但现有的微调方法提供的安全保证有限。当前的方法主要依赖于拉格朗日优化,通过对预期累积成本的软惩罚来强制安全,通常会导致剩余约束违规或过于保守的行为。此外,由于缺乏密集的每步安全注释,学习视觉领域的安全性具有挑战性。我们提出了 ShieldVLA,这是一种基于 Hamilton-Jacobi (HJ) 可达性的 VLA 模型的安全微调框架。 ShieldVLA 直接从视觉观察中学习 HJ 可达性值函数的无模型近似,以估计安全操作区域。博学的安全批评家通过将可行区域内的奖励最大化与不安全状态附近的恢复分开来控制策略优化,避免持续的奖励成本权衡。为了在视觉环境中实现可扩展的监督,我们引入了基于规则的 VLM 安全评分,将语义安全反馈转换为结构化的批评者目标,而无需手动成本标签。在跨越多个 VLA 主干的五个导航和操作基准中,与 SafeVLA 相比,ShieldVLA 平均将累积安全成本降低了 57%,并将任务成功率提高了 +0.13。