论文

Multi2AV-Safety:多模态到音视频生成安全性基准

Multi2AV-Safety: Benchmarking Safety in Multimodal-to-Audio-Video Generation

模型评测基准与评测资源

摘要

音视频生成正迅速从提示驱动的合成走向多模态条件化,文本、图像、音频和视频可以共同塑造生成的输出。这一转变改变了安全评估的性质:有害意图可能不再存在于任何单一输入中,而是从本各自良性或弱有害的条件跨模态、跨时间的交互中涌现。然而,现有安全基准大多仍以提示为中心或绑定固定的条件化接口,使这类组合性风险难以被系统研究。为弥合这一差距,我们提出Multi2AV-Safety,据我们所知是首个覆盖音视频生成全部11种非单一T/I/A/V条件化配置的安全基准,包含11,024个攻击实例。在Multi2AV-Safety上的评估揭示了代表性多模态安全防护在攻击机制和危害证据结构上的系统性弱点。我们的评估揭示了两种互补的失败模式:有害语义可以从各自良性的输入组合中涌现;而显式的有害线索在与良性多模态上下文混合时会变得更难检测。这些结果共同表明,组合性风险感知(compositional risk perception)是守护多模态条件音视频生成的核心能力缺口:即便所有条件化输入都可观测,当前安全防护也无法可靠地跨模态、跨时间整合安全证据。数据集将于2026年10月公开发布。

Multi2AV-Safety:多模态到音视频生成安全性基准:论文配图
图1:Multi2AV-Safety 概览:11,024 个攻击,覆盖文本、图像、音频和视频的全部 11 种多模态组合、四种攻击机制和五个危害类别。