论文
通过语义触发和心理框架对大型推理模型进行推理目标越狱攻击
Reasoning-targeted Jailbreak Attacks on Large Reasoning Models via Semantic Triggers and Psychological Framing
摘要
大型推理模型 (LRM) 在生成逐步推理链和最终答案方面表现出了强大的能力,使其能够部署在医疗保健和教育等高风险领域。虽然之前的越狱攻击研究主要关注最终答案的安全性,但很少关注推理过程的安全性。在这项工作中,我们发现了一个新问题,该问题将有害内容注入推理步骤,同时保留不变的答案。这种类型的攻击提出了两个关键挑战:1)操纵输入指令可能会无意中改变 LRM 的最终答案,2)输入问题的多样性使得难以持续绕过 LRM 的安全对齐机制并将有害内容嵌入到其推理过程中。为了应对这些挑战,我们提出了基于心理学的推理目标越狱攻击(PRJA)框架,该框架集成了基于语义的触发器选择模块和基于心理学的指令生成模块。具体来说,所提出的 PRJA 通过语义分析自动选择操纵推理触发器,并利用服从权威和道德脱离的心理学理论来生成自适应指令,以增强 LRM 对有害内容生成的合规性。对五个问答数据集的大量实验表明,PRJA 针对多种商业 LRM(包括 DeepSeek R1、Qwen2.5-Max 和 OpenAI o4-mini)的平均攻击成功率为 83.6%。