论文

Red-TTT:测试时训练用于自动越狱大语言模型

Red-TTT: Test-Time Training for Automated Jailbreaking Large Language Models

模型评测安全与风险评测

摘要

大语言模型仍然容易受到越狱的影响,而自动红队是在大语言模型中大规模查找越狱的标准方法。当前的方法要么在测试时通过搜索、重写和树扩展抽取更多样本,要么通过强化学习离线训练更强的攻击者。两者都有一个局限性:一旦开始对特定目标行为进行攻击,攻击者的权重就会被冻结。它收集到的有关该行为的任何信号都会保留在其上下文窗口中,然后被丢弃。攻击者从不在攻击中调整其提议分布,因此成功几乎完全取决于采样预算,并且在规模可承受的预算下,许多行为保持不变。我们提出Red-TTT,它在对每个行为进行攻击期间更新攻击者的参数。在每一轮中,攻击者都会对一组候选者进行采样,根据受害者的回复对它们进行评分,并在绘制下一组之前执行策略-梯度步骤,因此它对当前受害者的发现会合并为权重,而不是累积为上下文。我们还将训练目标调整为红队,其中成功是通过单个最佳样本而不是平均值来判断的。 Red-TTT 仅需要对受害者进行采样访问,并集成到现有的攻击管道中,无需进行其他更改。相对于 Best-of-N 基线,Red-TTT 在 120 个样本的预算下将攻击成功率平均从 55.9% 提高到 72.4%,在每种配置中都比基线有所改进,并破解了许多以前方法无法做到的行为。代码可在 https://github.com/SaFo-Lab/Red-TTT 获取

Red-TTT:测试时训练用于自动越狱大语言模型的原论文方法或结果图
图 1:Red-TTT 概述。在整个攻击过程中,使用固定攻击者进行标准的 Best-of-N 扩展搜索。 Red-TTT 将相同的攻击查询预算划分为几轮。在每一轮中,攻击者生成一组候选者,对受害者响应进行评分,并使用组相对优势在下一轮之前更新每个行为的低秩适配器。