论文

AudioGuard:跨不同威胁模型的全面音频安全保护

AudioGuard: Toward Comprehensive Audio Safety Protection Across Diverse Threat Models

模型评测安全与风险评测

摘要

音频已迅速成为基础模型的主要接口,为实时语音助手提供支持。确保音频系统的安全本质上比“大声朗读不安全的文本”更复杂:现实世界的风险可能取决于音频本地有害声音事件、说话者属性(例如儿童声音)、模仿/声音克隆滥用以及语音内容构成危害,例如儿童声音加上色情内容。音频的性质使得针对这种独特的风险状况制定全面的基准或防护措施具有挑战性。为了缩小这一差距,我们对音频系统进行了大规模的红队合作,系统地发现音频中的漏洞,并开发了全面的、基于政策的音频风险分类法和 AudioSafetyBench,这是第一个跨不同威胁模型的基于政策的音频安全基准。 AudioSafetyBench 支持多种语言、可疑声音(例如名人/模仿和儿童声音)、有风险的语音内容组合和非语音声音事件。为了防御这些威胁,我们提出了 AudioGuard,这是一个统一的护栏,包括 1) 用于波形级音频本机检测的 SoundGuard 和 2) 用于基于策略的语义保护的 ContentGuard。 AudioSafetyBench 和四个补充基准测试的大量实验表明,与基于 LLM 的强大音频基线相比,AudioGuard 持续提高了护栏精度,并且延迟显着降低。