论文
用大语言模型智能体对概念擦除做压力测试
Stress Testing Concept Erasure with Large Language Model Agents
摘要
概念擦除旨在从训练好的生成模型中移除语义概念,对负责任的AI部署日益重要。但验证模型是否稳健地移除了目标概念仍是关键挑战。现有评估方法通常预定义且静态,无法在多样自然语言探针与刁钻条件下暴露漏洞;人工设计的评估策略可能有偏且难以规模化。我们主张概念擦除评估最宜形式化为自适应假设搜索:由智能体迭代提出、批评并验证测试,系统性地扩大失败模式覆盖。为此我们提出STACE(概念擦除压力测试智能体),一个用多个LLM智能体自主压测概念擦除模型的框架:迭代生成并验证以外部知识为根基的压力测试假设。我们还引入一套度量,评估LLM智能体压力测试框架的表现与效率。大量实验显示,STACE在四个概念类别上优于五个基于LLM的评估基线;跨两个T2I模型、六种概念擦除方法与不同擦除强度的进一步分析表明STACE对不同设置稳健。STACE还可适配到概念擦除评估之外的问题域,如LLM越狱。代码匿名公开。
