碰撞前看到:具有冻结视觉语言模型的预期安全强化学习
Seeing Before Colliding: Anticipatory Safe RL with Frozen Vision-Language Models
摘要
约束强化学习算法优化所针对的成本信号几乎总是反应性的:模拟器仅在碰撞开始后才发出非零成本,并且 PPO-拉格朗日的拉格朗日乘数仅在超出情节预算后才会增长。在比赛速度下,碰撞是瞬时且不可逆转的,任何等待成本累积的安全机制在结构上都太晚了。我们提出了 VLM-Safe-RL,这是一个将冻结视觉语言模型集成到 CMDP 拉格朗日更新中作为预期成本项的框架。该框架包括四个贡献:(i)解耦双路径 CLIP,尊重 CMDP 分解的独立奖励/成本路径; (ii) VLM-Lagrange,一种增强乘数更新,其中包含每步 VLM 成本作为预期项; (iii) 置信门控,从 CLIP 边际上的逻辑噪声模型导出的贝叶斯最优权重; (iv) VLMPPOLag,组合算法。在 Safety-Gymnasium FormulaOne L2 中,我们的主要评估($n{=}5$ 种子、$10^{6}$ 步数、预算 $d_{\text{lim}}{=}25$)VLMPPOLag$+$Conf 是我们默认预算比较中唯一同时保留实质性回报 ($J_r{\approx}40$) 并将大多数种子成本控制在预算范围内的配置;五个约束感知基线(PPOLag、CPO、CPPOPID、CPO-CLG、PPOLag-RND)均至少未满足一项要求。该机制推广到保留的 MetaDrive Medium(灾难率 $41\%{\to}26\%$,95\% bootstrap CI $[-26,-5]$\,pp),并显示到 Bullet Safety-Gym 的方向一致传输;我们诚实地报告了不符合的情况(MetaDrive Easy/Hard、Qwen2-VL 主干),并将硬故障追溯到拉格朗日调节病理学而不是 VLM 信号本身。据我们所知,这是第一个使用冻结 VLM 信号作为 CMDP 拉格朗日更新内的预期成本项的工作。