论文

TrajShield:用于保护文本到视频模型免受越狱攻击的轨迹级安全中介

TrajShield: Trajectory-Level Safety Mediation for Defending Text-to-Video Models Against Jailbreak Attacks

上下文与知识上下文工程

摘要

文本到视频(T2V)模型在根据自然语言提示生成时间连贯的视频方面表现出了卓越的能力,但它们也存在产生不安全内容(例如暴力或露骨内容)的风险。现有的提示级防御很大程度上继承自文本到图像的安全性,并在输入的词汇表面上运行,使它们容易受到越狱攻击,这些攻击通过改写或对抗性提示来掩盖有害意图。此外,T2V 生成引入了先前工作忽视的独特挑战:暂时出现的风险,其中看似良性的提示通过生成器对叙事连贯性的时间外推导致不安全的内容。我们提出 \method{},一种 无需训练 推理时间防御框架,它将 T2V 安全性重新表述为时间结构化语义空间中的因果干预。 TrajShield 通过模拟提示的隐含轨迹、定位潜在风险的因果起源以及应用微创重写来中和风险,同时保留与安全无关的语义,从而以统一的方式处理显式的不安全提示、越狱攻击和临时出现的风险。在 T2VSafetyBench 上跨 14 个安全类别和多个 T2V 后端的实验表明,TrajShield 在保持高语义保真度的同时实现了最先进的防御性能,大大优于现有防御,平均 ASR 降低了 52.44%。