论文

面对隐性风险时,视觉语言模型能否继续发挥作用?意图-特权 OPSD 用于有效的安全-有用性协调

Can Vision-Language Models Stay Helpful When Facing Implicit Risks? Intent-Privilege OPSD for Efficient Safety-Helpfulness Alignment

摘要

视觉语言模型(VLM)仍然容易受到跨模式隐性风险的影响:单独看来良性的视觉和文本输入可能会共同引发不安全的反应。现有的安全方法通常需要大量的偏好数据集、昂贵的多次部署训练或推理时的额外保护措施。他们还可能通过直接拒绝可以安全答复的请求来牺牲帮助。在本文中,我们提出了意图特权政策自蒸馏(OPSD),它在训练期间利用基于证据的意图作为特权监督,帮助 VLM 识别隐性风险并提供安全、有用的响应,而不是一揽子拒绝。 OPSD 使用每个提示的单一rollout,将教师对反应的意图条件偏好提炼给学生;然后,学生在没有意图注释或附加安全模块的情况下做出响应。 OPSD 仅包含 1,447 个安全特定示例(比标准偏好数据集少 95%),相对于多次部署 GRPO 式训练,训练时间减少了 5 倍,平均推理长度减少了 7%。它获得了联合安全-有用成功率的最高比率,该比率衡量了所有五个评估组中既安全又有用的响应的比例。值得注意的是,在合并的 SIUO+HoliSafe 上,这一成功率从 43.9% 上升到 53.5%。这些结果表明,训练时意图监督可以提高安全性和有用性,同时大幅降低数据、训练和推理成本。