论文

噪声中的低语:经由多智能体框架的代理引导概念唤醒

Whispers in the Noise: Surrogate-Guided Concept Awakening via a Multi-Agent Framework

模型评测安全与风险评测

摘要

扩散模型(DM)被广泛用于文本到图像生成,但其强大的生成能力也引发了对不安全或不良内容的担忧。概念擦除旨在通过从预训练模型中移除特定概念来缓解这些风险。然而,近期研究表明这类方法往往是抑制而非彻底消除目标概念,使模型容易受到唤醒攻击。现有方法主要依赖通过优化或反演获得白盒访问,而黑盒约束下的概念唤醒仍未被充分探索。在本工作中,我们从轨迹视角重新审视去噪过程,发现概念擦除主要破坏早期文本-语义对齐,但并不能完全阻止语义信息沿去噪动力学传播。随着生成推进,模型日益依赖不断演化的噪声状态而非文本条件,这为绕过被擦除的映射创造了机会。基于这一观察,我们提出ConceptAgent,一个免训练、黑盒的多智能体框架,通过以代理模型引导的噪声状态初始化去噪轨迹来唤醒被擦除的概念。大量实验证明,ConceptAgent能够在黑盒设置下实现对被擦除概念精确且可控的唤醒,且无需访问模型参数、梯度或内部表示。这些结果凸显了当前概念擦除方法的根本局限,并为DM中语义控制的动态本质提供了新见解。

噪声中的低语:经由多智能体框架的代理引导概念唤醒:论文配图
图1:被擦除LDM中不同条件下的去噪轨迹,由文本条件与语义噪声估计驱动。