论文

SafeDojo:通过交互式世界模型进行 VLA 的安全强化学习

SafeDojo: Safe Reinforcement Learning for VLA via Interactive World Model

模型训练强化学习

摘要

安全控制是现实世界体现智能的先决条件,安全强化学习已成为一种有前途的范例。然而,现有的安全强化学习方法要么需要昂贵的现实世界探索,要么依赖于手工制作的安全功能。两者都无法扩展到部署在开放世界物理环境中的视觉-语言-动作模型。我们提出了 SafeDojo,这是第一个基于模型的视觉-语言-行动政策安全强化学习框架,旨在通过基于世界模型的想象力来学习安全行动。具体来说,SafeDojo 在交互式视频世界模型之上执行在线强化学习。世界模型生成以动作为条件的未来预测,定制的 ResNet 成功分类器根据想象的帧估计每步任务进度,轻量级安全头根据潜在上下文和建议的动作块预测每步安全成本,从而能够同时评估任务执行和轨迹安全。解耦的任务奖励和安全成本信号通过基于拉格朗日的约束 GRPO 目标进行平衡,从而能够在明确的约束下协调改进任务的成功和安全性。在 SafeLIBERO 上,SafeDojo 在推理时间安全性、无模型 RL 和基于模型的 RL 基线中实现了最佳的总体任务成功率、安全成功率和执行效率,在两个级别上均具有最佳平均安全成功率,并且比 I 级最强基线提高了 8.25 个百分点。现实世界的 Franka 部署进一步显示了五个任务中的最佳平均任务率和安全成功率。我们的结果将基于世界模型的安全强化学习定位为通向安全体现智能的可扩展且可推广的路径。