论文
互惠不安全:生成理解耦合如何破坏统一多模式模型中的安全性
Unsafe by Reciprocity: How Generation-Understanding Coupling Undermines Safety in Unified Multimodal Models
摘要
大语言模型 (LLM) 和文本到图像 (T2I) 模型的最新进展导致了统一多模态模型 (UMM) 的出现,其中多模态理解和图像生成紧密集成在共享架构中。先前的研究表明,这种互惠通过共享表示和联合优化增强了跨功能性能。然而,这种紧密耦合的安全影响在很大程度上仍未得到探索,因为现有的安全研究主要是孤立地分析理解和生成功能。在这项工作中,我们研究了跨功能互惠本身是否构成 UMM 脆弱性的结构性来源。我们提出了 RICE:基于交互交互的跨功能开发,这是一种新颖的攻击范式,明确地利用了理解和生成之间的双向交互。使用该框架,我们系统地评估了生成到理解(G-U)和理解到生成(U-G)攻击路径,证明不安全的中间信号可以跨模式传播并放大安全风险。大量实验表明,两个方向的攻击成功率 (ASR) 都很高,揭示了之前被忽视的 UMM 固有的安全弱点。