论文

Stable-GFlowNet:通过对比轨迹平衡迈向多样化和稳健的 LLM 红队

Stable-GFlowNet: Toward Diverse and Robust LLM Red-Teaming via Contrastive Trajectory Balance

模型评测安全与风险评测

摘要

大语言模型(LLM)红队主动识别LLM的漏洞,是确保安全的重要流程。在红队中找到有效且多样化的攻击很重要,但实现这两点具有挑战性。执行分布匹配的生成流网络(GFN)是很有前途的方法,但它们因训练不稳定和模式崩溃而臭名昭著。特别是红队加速模式中不稳定的奖励崩溃。我们提出了 Stable-GFN (S-GFN),它消除了 GFN 中的配分函数 $Z$ 估计并降低了训练的不稳定性。 S-GFN 通过成对比较避免 $Z$ 估计,并采用强大的屏蔽方法来对抗噪声奖励。此外,我们提出了一种流畅性稳定器,以防止模型陷入产生乱码的局部最优。 S-GFN提供更稳定的训练,同时保持GFN的最优策略。我们展示了 S-GFN 在各种设置下的压倒性攻击性能和多样性。我们的代码可以在 https://github.com/kmc0207/Stable-GFN 中找到。