论文

PsychJail:通过LLM策略的多轮说服探索心理学越狱

PsychJail: Exploring Psychological Jailbreaks via Multi-Turn Persuasion of LLM Policies

模型评测安全与风险评测

摘要

大语言模型(LLM)越来越多地部署于教育、医疗、政策咨询等交互场景,用户将其视为持续的社会对话者而非一次性查询引擎。这一转变使越狱成为日益增长的安全威胁,但多数研究强调单轮提示优化或迭代攻击精化,有心理学依据的多轮漏洞仍未被充分探索。我们提出PsychJail,一个以心理学为指导、通过有理论依据的多轮说服对齐LLM进行红队测试的框架。PsychJail将成熟的社会心理学说服技术映射为以战术为条件的攻击策略。它将攻击者的每个动作分解为意义变化分析(Change-of-Meaning analysis)、战术选择和受害者可见消息,从而操作化说服知识模型(PKM)。该策略通过轨迹级强化学习精化,奖励采用PKM门控:只有当每一轮都包含格式良好的意义变化分析时,早期越狱成功才获得奖励。在四个对齐受害者模型上,PsychJail取得最高的平均攻击成功率(87.3%),并在每个模型上都优于强大的单轮与多轮基线。我们还在攻破每个受害者的那个动作处测量易感性,揭示出四种不同的模型级指纹,它们识别哪些说服杠杆影响每个模型以及影响范围有多广。这些指纹有助于解释跨模型迁移的不对称性。我们将它们解释为四种候选心理画像——理性主义型、可信度驱动型、叙事单一型和广易说服型——同时把这一解释视为有待未来验证的猜想。我们的发现将心理学越狱确立为日益交互化的LLM的一个独特红队测试前沿。

PsychJail:通过LLM策略的多轮说服探索心理学越狱:论文配图
图1:PsychJail 框架概览。对每个有害目标 𝒙0,攻击者 πθ 发出分解的动作 𝒂t=(𝒏t,ct,𝒎t);只有 𝒎t 到达冻结的受害者 πv;评判器 πJ 将 𝒚t 评分为 st∈[0,1]。任一轮出现严格解析失败都会截断轨迹。轨迹奖励将逐轮格式得分与峰值成功项相结合,后者由每轮与 PKM 对齐的意义变化分析所门控。