论文

视觉语言模型的视觉定位安全性

Visual Grounding Safety in Vision-Language Models

模型评测安全与风险评测

摘要

视觉语言模型 (VLM) 越来越多地被训练来生成结构化输出,例如下游接口、智能体和机器人可以采取行动的点和边界框,但该输出通道的安全对齐尚未得到系统分析。我们通过将涵盖直接伤害 (VLSU)、社会偏见 (BBQ-V) 和情境安全 (Asimov-2.0) 的三个安全基准重新调整为 15,401 对匹配的有害请求来研究视觉定位安全,这些请求仅在请求的输出上有所不同:自由文本答案 (VQA) 或视觉定位(点或边界框)。在五个VLM中,拒绝作为问题提出的有害请求的模型通常会在同一请求要求视觉定位时遵守:对模型进行平均,视觉定位拒绝比 VQA 拒绝低 31-59 个百分点,具体取决于领域,并且安全系统提示无法缩小这一差距。我们提出了一种微调方法,将定位形式的拒绝样本与定位能力数据和自我蒸馏良性数据相结合,以应对过度拒绝。对于 Qwen3-VL-8B 和 VisionReasoner-7B,它在 VLSU 和 BBQ-V 上将视觉定位拒绝改善了 77-95 个百分点,在留出 Asimov-2.0 域上将视觉定位拒绝改善了 64-85 个百分点,同时还改善了 VQA 拒绝,保留了视觉定位能力,并限制了过度拒绝。表示分析表明,微调将有害请求移向每个模型的拒绝方向,最强烈的是视觉定位,同时将良性请求保留在无害参考附近。