论文

冻结VLM安全分数可能衡量提示库,而非危险本身

It Is Not Seeing the Hazard: A Frozen Vision-Language Safety Score Measures Its Caption Bank

模型评测模型训练奖励建模与过程监督模型行为与机制分析安全与风险评测

摘要

冻结的视觉语言模型越来越多地为强化学习提供安全信号。它们的使用假设与描述危险的语言的相似性表明了危险本身。然而,策略回报和碰撞率无法揭示分数是否检测到危险或对场景的相关特征做出反应。基于 VLM 的方法通过将图像文本相似性转换为奖励、成本或置信度权重,在驾驶和安全强化学习基准方面取得了进展。此类信号有望减少对手动设计反馈的依赖。它们还可能反映提示结构、嵌入几何形状或摄像机视角,而其安全意义未经验证。为了解决这一差距,我们对冻结的 CLIP 即时裕度安全评分进行了受控评估。我们将分数应用于从未收到分数的策略生成的轨迹,将接触前观察与具有可比危险几何形状的无接触观察相匹配,并改变标题、编码器和摄像机视图。在三项政策、180 次发作和 130 次孤立的接触发作中,分数在接触前下降了约 20 步。机制控制表明,分数主要跟踪与其字幕共享的场景的相似性以及随字幕分离和摄像机视图的变化。恒定置信控制保留了较低的灾难率点估计,因此政策收益不会建立危险感知。

冻结VLM安全分数可能衡量提示库,而非危险本身:论文原图
图 7:字幕及其评分所依据的帧。顶部:八个逐字字幕,以及每个记分员如何使用它们。中:以自我为中心的框架,在接触前和接触时的四个滞后处计算分数。底部:同一五个时刻的独立俯视图,没有乐谱看到。我们将其包含在内,以便读者可以了解世界上正在发生的事情。随着轨道的退去,障碍物充满了视野。画面正在离开字幕所描述的场景,这就是乐谱第四部分所说的内容。这些图像来自重播轨迹的 1024×10241024×1024 渲染,因此在放大时仍清晰可见。评分员获得相同模拟器状态的 256×256256×256 渲染,CLIP 将其大小调整为 224×224224×224(附录 C.1)。