论文

LLM中RL越狱的系统研究

A Systematic Investigation of RL-Jailbreaking in LLMs

模型评测安全与风险评测

摘要

生成模型从下一个词元预测器到复杂系统的自主引擎的演变需要严格的安全强化。对抗性越狱,即对模型进行战略性操纵以产生有害输出,仍然是安全部署的主要威胁。虽然强化学习 (RL) 将越狱定义为通过顺序优化的多步骤攻击,但对该框架成功原因的机械理解仍然不完整。为了填补这一空白,我们提出了 RL 越狱的第一个系统分解。我们将框架解构为问题形式化(奖励函数、动作空间、情节长度)和算法度量(强化学习算法、训练数据、奖励塑造),以确定对抗成功的结构性决定因素。我们的结果表明,RL 越狱者成功破坏了所有目标模型和防护措施。通过这种史无前例的分析,我们证明环境形式化,特别是密集的奖励和延长的情节长度,是越狱成功的主要驱动力。这项工作提供了一种提高强化学习越狱效率的工具,并最终强化生成模型以抵抗基于强化学习的攻击。