论文

MJ:通过分解信用分配进行多轮LLM越狱

MJ: Multi-turn LLM Jailbreaking via Decomposed Credit Assignment

模型评测安全与风险评测

摘要

现代 大语言模型 (LLM) 在交互式多轮设置中运行,使多轮越狱成为现实的威胁模型和自动红队的重要设置。学习多回合越狱攻击者的一个核心挑战是信用分配:不同的回合对最终结果的贡献不同,但现有的学习信号通常过于粗糙,无法识别他们的个人贡献。我们提出了分解信用GRPO(DC-GRPO),这是一种统一的回合级信用分配框架,用于多轮越狱学习中的组相对策略优化。 DC-GRPO 通过结合当前和未来的信用,为每个回合分配一个单独的与组相关的学习信号,避免因在对话中广播单个轨迹级分数而引起的信用分配错误。我们用静态和动态加权规则实例化这个框架,这些规则的不同之处在于如何平衡两个信用来源,同时共享相同的轮次级别结构。在多个受害者 LLM 和基准测试中,动态和静态加权变体的平均 ASR5@3 分数分别为 98.26% 和 97.88%,大大优于最先进的方法,包括 SEMA (86.58%) 和 TROJail (86.23%)。他们一贯的强劲表现表明,核心经验效益来自于轮次级别的相对于组的信用分配,而不是特定的加权规则。警告:本文包含有害内容的示例。