论文

安全转向:通过综合自举和反馈动力学改进多匝 MLLM

SaFeR-Steer: Evolving Multi-Turn MLLMs via Synthetic Bootstrapping and Feedback Dynamics

模型训练强化学习

摘要

MLLM 越来越多地部署在多轮环境中,攻击者可以通过不断演变的视觉文本历史来升级不安全意图,并利用长上下文安全衰减。然而,安全对齐仍然以单轮数据和固定模板对话为主,导致训练和部署之间存在不匹配。为了弥补这一差距,我们提出了 SafeR-Steer,这是一种渐进式多轮对齐框架,它将分阶段合成引导与导师循环 GRPO 相结合,在自适应 同策略 攻击下训练单个学生。我们还引入了轨迹一致总结性奖励(TCSR),它汇总了转弯奖励的历史最小值和平均值,以便任何低质量的转弯都会影响轨迹级别的回报。一、数据集。我们发布了 STEER,这是一个多转弯多模式安全数据集,其中包含跨越 1-10 圈的 STEER-SFT (12,934)、STEER-RL (2,000) 和 STEER-Bench (3,227) 对话。二.实验。从 Qwen2.5-VL-3B/7B 开始,SaFeR-Steer 显着提高了单匝(3B 为 48.30/45.86 $\rightarrow$ 81.84/70.77;7B 为 56.21/60.32 $\rightarrow$ 87.89/77.40)和多匝基准的安全性/实用性(3B 为 12.55/27.13 $\rightarrow$ 55.58/70.27;7B 为 24.66/46.48 $\rightarrow$ 64.89/72.35),将失败转移到后面的回合,并产生超越单独缩放的鲁棒性。代码可在 https://github.com/Ed-Bg/SaFeR-Steer-full 获取