论文
安全响应很重要:输出感知安全护栏可减少 MLLM 中的过度拒绝
Safe responses matter: Output-aware safety guardrail mitigate over-refusal in MLLMs
摘要
多模式 大语言模型 (MLLM) 的现有安全机制面临着安全性和实用性之间的根本权衡。 微调 型号实现了强大的安全性,但牺牲了通用性。输入端安全护栏提供了一种轻量级的替代方案,但它们遭受严重的过度拒绝、不加区别地阻止良性查询或模型可以通过拒绝或咨询响应安全回答的查询。我们发现过度拒绝的根本原因在于输入感知范式:安全护栏在不考虑模型本身是否能够生成安全响应的情况下做出安全决策。通常,MLLM 已经拥有本质安全机制,可以将有害输入转化为无害输出,但输入侧安全护栏会覆盖此功能,从而降低用户体验。受这种洞察力的启发,我们提出了向输出感知安全护栏的范式转变。我们的方法在模型的隐藏状态空间内运行,以预测即将到来的一代在完全生产之前是否不安全。通过对隐藏状态表示进行多实例对比学习来训练轻量级分类器,我们的方法可以区分会导致不安全输出的输入和不会导致不安全输出的输入,即使输入本身包含风险元素。只有当模型的实际响应有害时,才能进行精确干预。大量的实验表明,我们的输出感知安全护栏与现有方法的安全性能相匹配,同时大大减少了过度拒绝,保留了模型的实用性和内置安全功能。代码位于:https://github.com/kunzhan/OutGuard