论文
拉动缰绳:无需训练 通过表示转向实现视频扩散模型的安全对齐
Pulling The REINS: Training-Free Safety Alignment of Video Diffusion Models via Representation Steering
摘要
开放权重视频扩散模型可以生成逼真的不安全内容,从暴力到错误信息,但现有的防御要么需要昂贵的安全 微调 来降低一般能力,要么应用外部过滤器,而这些过滤器很容易被对抗性提示绕过。我们提出了 REINS(表示空间推理时间安全转向),这是一种 无需训练 方法,通过将视频扩散模型的内部表示转向安全生成来在推理时间对齐视频扩散模型。我们的主要发现是,安全相关结构在视频扩散 Transformer 的隐藏状态激活中线性编码,并且通过二进制安全标签上的监督 PCA 发现的单个方向足以将安全与不安全的生成轨迹分开。推理时,将此方向添加到中间 Transformer 层的隐藏状态会将生成从有害内容重定向到语义相关的安全替代方案,无需权重更新,无需概念枚举,并且计算开销可以忽略不计。通过机制分析,我们发现,虽然安全信息随着 Transformer 深度单调累积,但转向有效性在中间层(~50% 深度)达到峰值,揭示了信息可用性和下游传播能力之间的基本权衡。据我们所知,我们跨 9 个视频扩散模型、多个参数尺度 (1.3B-5B) 以及文本到视频和图像到视频生成来评估 REINS,这是视频生成文献中最广泛的安全评估套件。