论文

SafeCA:文本到视频越狱防御的安全交叉注意力定位和监管

SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense

模型推理解码与生成控制

摘要

文本到视频 (T2V) 生成模型在实际部署中很容易受到越狱攻击,从而导致生成有害或不适当的内容。现有的防御方法主要依赖于输入过滤或重建,这不仅会导致较高的计算延迟,而且往往会扭曲语义。为了解决这些问题,我们通过实验系统地分析了干净样本和越狱样本在交叉注意力特征空间中的差异,首次揭示了扩散过程中两者之间的累积分离效应以及线性可分离性逐渐增加的趋势。基于这一见解,我们提出了 SafeCA,一种用于安全交叉注意力定位和正则化的特征级防御机制。首先,我们使用从单个推理中的干净提示中收集的交叉注意特征,通过注意稳定性分析来识别关键防御区域和价值。其次,SafeCA 通过能量归一化的注意力屏蔽来减轻异常激活,并引入轻量级语义空间适配器来重定向异常语义流。此外,我们通过将特征异常信号反向传播到输入提示词来检测和抑制潜在的恶意标记,从而增强商业模型中防御的可部署性。实验结果表明,SafeCA在主流T2V模型上降低越狱成功率约20%,几乎不增加推理开销(+0.1s),并保持良好的文本视频语义一致性。总体而言,SafeCA 为 T2V 生成模型提供了架构级、可部署的保护范例。