论文

SyncBreaker:对音频驱动的说话头生成的阶段感知多模式对抗攻击

SyncBreaker:Stage-Aware Multimodal Adversarial Attacks on Audio-Driven Talking Head Generation

AI 基础设施模型评测AI安全与内容治理基础设施安全与风险评测

摘要

基于扩散的音频驱动的头像生成可以实现逼真的肖像动画,但也带来了误用的风险,例如欺诈和错误信息。现有的保护方法很大程度上局限于单一模态,纯图像攻击和纯音频攻击都无法有效抑制语音驱动的面部动态。为了解决这一差距,我们提出了 SyncBreaker,这是一种阶段感知的多模态保护框架,可在特定模态的感知约束下联合扰乱肖像和音频输入。我们的主要贡献是双重的。首先,对于图像流,我们在扩散阶段引入多间隔采样(MIS)的无效监督,通过聚合多个去噪间隔的指导来引导生成静态参考肖像。其次,对于音频流,我们提出了交叉注意力愚弄(CAF),它抑制特定于间隔的音频条件交叉注意力响应。两个流均独立优化并在推理时组合以实现灵活部署。我们在白盒主动保护设置中评估 SyncBreaker。大量实验表明,SyncBreaker 比强大的单模态基线更有效地降低唇同步和面部动态,同时保持输入感知质量并在净化下保持鲁棒性。代码:https://github.com/kitty384/SyncBreaker。