论文
SafeCap:通过图像字幕强化学习提高 LVLM 安全性
SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning
摘要
大型视觉语言模型(LVLM)仍然容易受到越狱攻击,这些攻击利用视觉输入绕过从其语言主干继承的安全对齐。我们提出了 SafeCap,这是一种强化学习框架,可通过学习的自我字幕来调整 LVLM。 SafeCap 训练策略模型,首先生成与安全相关的图像说明,然后生成最终答案;通过是否使冻结的 LLM 能够达成安全一致的决策来进一步优化标题。这种以标题为媒介的目标鼓励政策公开与安全响应生成相关的视觉线索,而不是仅仅依赖于直接拒绝监督。在五个多模式安全基准和六个视觉效用基准中,SafeCap 在其预期的 DirectCap 协议下显着提高了总体安全性能,四种模型设置的安全平均值提高了 3.7-19.0 点,同时保持可比较或改进的视觉效用。在匹配主干网和数据的受控比较下,SafeCap 优于安全 SFT、DPO 和 SafeGRPO,证明了字幕介导的强化学习对于多模式安全对齐的有效性。