论文
SafeGen-Bench:图像条件文本到视频生成的安全性基准测试
SafeGen-Bench: Benchmarking Safety in Image-Conditioned Text-to-Video Generation
摘要
随着文本到图像扩散模型的快速进步,像 Sora 这样的生成视频模型(T2V 模型)现在可以根据文本提示或初始图像生成简短的合成视频。然而,合成视频生成——尤其是在初始图像指导下——通常会带来风险,包括可能创建非法、政治敏感或不道德的内容。现有的基准测试已经开始考虑生成视频的安全性,但主要侧重于测试带有恶意文本提示的模型,忽略了文本提示和图像组合仍然可能导致有害视频内容的场景。在实践中,这是一个常见且具有挑战性的问题:从安全文本和图像输入生成的视频仍然可以传达有害信息。为了弥补这一差距,我们引入了 SafeGen-Bench,这是一个专门为评估条件 T2V 模型的安全性而设计的基准。我们的基准定义了 10 个恶意类别,重点关注与时间序列和所描述行为相关的风险。 SafeGen-Bench 由来自不同图像和视频源的精心挑选的起始帧组成,并与相应的文本提示配对以模拟真实的输入。我们在 SafeGen-Bench 上评估了各种条件 T2V 模型,结果表明,当前模型很难始终避免生成不安全分数高达 44.5 的恶意内容,特别是在要求高质量的条件下。此外,我们在基准测试中评估了基于文本和基于图像的护栏的有效性,发现单模式护栏不足以提供强大的防御,七个恶意类别的失败率为 80%。我们希望 SafeGen-Bench 能够促进更安全、更可控的条件 T2V 模型的开发。