论文

用于强化学习越狱攻击大推理模型的注意力引导奖励

Attention-Guided Reward for Reinforcement Learning-based Jailbreak against Large Reasoning Models

模型评测安全与风险评测

摘要

大型推理模型(LRM)通过生成结构化的分步推理内容,在解决复杂问题上展现出卓越能力。然而暴露模型内部推理过程会带来额外的安全风险;例如,近期研究表明LRM比标准LLM更容易受到越狱攻击。本文研究针对LRM的越狱攻击,并揭示攻击成功率(ASR)与LRM的注意力模式密切相关。具体而言,成功的越狱往往对输入提示中的有害token分配较低注意力,而在推理内容中为这些token分配较高注意力。受此发现启发,我们提出一种针对LRM的新型越狱方法,利用强化学习(RL)增强攻击效果,并将注意力信号显式纳入奖励函数设计。此外,我们引入多样的说服策略来丰富RL动作空间,这持续提升了ASR。在三个基准上对五个开源与闭源LRM的大量实验表明,我们的方法取得显著更高的ASR,在有效性、效率和可迁移性上均优于现有方法。

用于强化学习越狱攻击大型推理模型的注意力引导奖励:论文配图
图 1. 比较失败(左)和成功(右)越狱攻击的示例。失败的案例有 A​Pp=4.3%AP_{p}=4.3\% 和 A​Pr=0.7%AP_{r}=0.7\%,而成功的案例有 A​Pp=2.7%AP_{p}=2.7\% 和 A​Pr=6.8%AP_{r}=6.8\%。