论文
时间调节差距:文本到视频的安全过滤器对运动中的伤害视而不见
The Temporal Moderation Gap: Text-to-Video Safety Filters Are Blind to Harm in Motion
摘要
文本到视频 (T2V) 服务继承了图像生成的安全堆栈,将关键字提示过滤器与每帧检查器配对,每当一个采样帧看起来不安全时,该检查器就会阻止剪辑。这个堆栈有一个视频特有的盲点。我们证明,任何忽略帧顺序的主持人只要接受该剪辑的良性洗牌,就会接受该剪辑,因此仅由顺序带来的伤害就可以逃脱。根据经验,未经修改的基准提示已经在超过四个保留种子的 32.7% 的顺序操作目标上缩小了这一调节差距,并且释义、场景分割和反馈驱动的提示搜索没有显示出显着的改进(配对 McNemar $p\ge0.12$),因此不需要提示工程来暴露该漏洞。对所有 97 个渲染帧进行密集评分显示,大约三分之一的交付剪辑只是隐藏了不安全的帧,而其余的剪辑仍然有害,因为即使每一帧都通过了有序视频,未修改的提示会在四分之一的顺序操作目标上产生顺序盲残差。我们还记录了一个测量陷阱,因为在其自己的渲染种子上对搜索提示进行评分会将每代 7.5% 的比率夸大到明显的 46.7%。一项用户研究证实,人们认为这些片段有害,而他们的随机播放则认为是安全的。解决方法是读取帧顺序,并且顺序感知检测器以 AUC 0.74 将这些剪辑与它们自己的随机播放分开,其中每帧检查都是偶然的,这是部署的调节丢弃的信号。