论文
PsychJail:通过LLM策略的多轮说服探索心理学越狱
PsychJail: Exploring Psychological Jailbreaks via Multi-Turn Persuasion of LLM Policies
摘要
大语言模型(LLM)越来越多地部署于教育、医疗、政策咨询等交互场景,用户将其视为持续的社会对话者而非一次性查询引擎。这一转变使越狱成为日益增长的安全威胁,但多数研究强调单轮提示优化或迭代攻击精化,有心理学依据的多轮漏洞仍未被充分探索。我们提出PsychJail,一个以心理学为指导、通过有理论依据的多轮说服对齐LLM进行红队测试的框架。PsychJail将成熟的社会心理学说服技术映射为以战术为条件的攻击策略。它将攻击者的每个动作分解为意义变化分析(Change-of-Meaning analysis)、战术选择和受害者可见消息,从而操作化说服知识模型(PKM)。该策略通过轨迹级强化学习精化,奖励采用PKM门控:只有当每一轮都包含格式良好的意义变化分析时,早期越狱成功才获得奖励。在四个对齐受害者模型上,PsychJail取得最高的平均攻击成功率(87.3%),并在每个模型上都优于强大的单轮与多轮基线。我们还在攻破每个受害者的那个动作处测量易感性,揭示出四种不同的模型级指纹,它们识别哪些说服杠杆影响每个模型以及影响范围有多广。这些指纹有助于解释跨模型迁移的不对称性。我们将它们解释为四种候选心理画像——理性主义型、可信度驱动型、叙事单一型和广易说服型——同时把这一解释视为有待未来验证的猜想。我们的发现将心理学越狱确立为日益交互化的LLM的一个独特红队测试前沿。
