论文

Persona Non Grata:单一方法的安全评估对人格化LLM并不完整

Persona Non Grata: Single-Method Safety Evaluation Is Incomplete for Persona-Imbued LLMs

模型评测安全与风险评测

摘要

人格注入可定制LLM行为,但安全评估几乎总是只研究基于提示的人格。我们证明这并不完整:提示与激活导向暴露出不同的、依赖架构的脆弱性画像,仅用一种方法测试可能遗漏模型的主要失败模式。在来自三个架构家族的四个标准模型、共5,568个受评条件上,系统提示下的人格危险度排序在所有架构间保持一致(ρ=0.71-0.96),但激活导向脆弱性急剧分化且无法从提示侧排序预测:Llama-3.1-8B对激活导向(AS)显著更脆弱,而Gemma-3-27B与Qwen3.5更易受提示攻击。这一分化最突出的例证是亲社会人格悖论:在Llama-3.1-8B上,P12(高尽责性+高宜人性)在提示下属于最安全的人格,却成为激活导向下攻击成功率(ASR)最高的人格(ASR约0.818)。这一反转对系数消融与等强度校准均稳健,并在DeepSeek-R1-Distill-Qwen-32B上得到复现。一个特质-拒绝对齐框架(其中尽责性在Llama-3.1-8B上与拒绝强负对齐)提供了部分几何解释。推理只提供部分保护:两个32B推理模型的提示侧ASR达到15-18%,激活导向则在基线易感性与人格特异性脆弱性两方面将二者急剧区分开来。启发式轨迹诊断表明,更安全的模型保留了更强的政策召回与自我纠错行为,而不仅仅是更长的推理。

Persona Non Grata:单一方法的安全评估对人格化LLM并不完整:论文配图
图 3:跨模型漏洞比较。 (a) 按模型划分的 ASR 方法。 (b) 系统提示下的代表性高风险角色,表明提示端漏洞模式在各个体系结构中广泛保留,但具体顺序不同。 (c) 四个标准模型之间的成对系统提示人物等级相关性。