论文

不是每轮都重要:多轮越狱的贡献归因

Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking

模型训练强化学习Agentic RL

摘要

在多轮对话中部署LLM有助于越狱攻击,将有害意图分散到看似良性的轮次中。最近基于训练的多回合越狱方法从交互反馈中学习长视野攻击策略,但通常依赖于均匀广播到每个回合的粗略轨迹级结果信号。然而,我们发现多轮越狱中的轮级贡献是不均匀的、阶段相关的和特定于目标的。这种粗略的结果监督会引发贡献归因问题,导致对成功轨迹中的冗余转弯给予过度奖励,而对失败轨迹中有用的中间转弯低估。为了解决这个问题,我们提出了 TRACE,一种回合感知贡献归因框架,用于基于强化学习 (RL) 的多轮越狱。对于成功的轨迹,TRACE 通过留一转出语义屏蔽来估计转级贡献;对于失败的,TRACE 根据即时危害性和语义相关性进行处罚,并附加本地拒绝感知处罚。此外,我们重用攻击方信用信号进行多轮防御对齐。对开源和闭源目标的大量实验表明,TRACE 在有效性、可转移性和效率方面实现了强大的整体性能,与最强的 RL 基线相比,攻击成功率相对提​​高了约 25%,同时在重新用于防御调整时还提高了安全性与实用性的平衡。

不是每轮都重要:多轮越狱的信用分配:论文配图
图 1:TRACE 概述。现有的多轮越狱训练范例依赖于启发式工作流程、DPO 或具有轨迹级结果奖励的 RL。 TRACE 保持多转弯 RL 部署不变,但通过转弯级别贡献、区分设置、冗余、过早暴露和关键转弯将最终结果信号分配给各个转弯。