论文
冻结VLM安全分数可能衡量提示库,而非危险本身
It Is Not Seeing the Hazard: A Frozen Vision-Language Safety Score Measures Its Caption Bank
摘要
冻结的视觉语言模型越来越多地为强化学习提供安全信号。它们的使用假设与描述危险的语言的相似性表明了危险本身。然而,策略回报和碰撞率无法揭示分数是否检测到危险或对场景的相关特征做出反应。基于 VLM 的方法通过将图像文本相似性转换为奖励、成本或置信度权重,在驾驶和安全强化学习基准方面取得了进展。此类信号有望减少对手动设计反馈的依赖。它们还可能反映提示结构、嵌入几何形状或摄像机视角,而其安全意义未经验证。为了解决这一差距,我们对冻结的 CLIP 即时裕度安全评分进行了受控评估。我们将分数应用于从未收到分数的策略生成的轨迹,将接触前观察与具有可比危险几何形状的无接触观察相匹配,并改变标题、编码器和摄像机视图。在三项政策、180 次发作和 130 次孤立的接触发作中,分数在接触前下降了约 20 步。机制控制表明,分数主要跟踪与其字幕共享的场景的相似性以及随字幕分离和摄像机视图的变化。恒定置信控制保留了较低的灾难率点估计,因此政策收益不会建立危险感知。
