论文
大语言模型的信息论对抗训练
Information Theoretic Adversarial Training of Large Language Models
摘要
尽管在一致性和安全性方面取得了进步,大语言模型(LLM)仍然容易受到对抗性提示的影响,并且经常在新颖的攻击策略下表现出有害行为。虽然对抗性训练可以提高鲁棒性,但现有方法的计算成本高昂且难以扩展。最近的连续对抗训练方法,例如连续对抗训练(CAT)和连续对抗偏好优化(CAPO),通过利用嵌入空间中基于梯度的扰动来解决这一挑战,从而实现更高效和更具表现力的攻击。在此范式的基础上,我们提出了 WARDEN,这是一种针对 LLM 的分布式鲁棒对抗训练框架,它通过围绕经验训练分布设置的 f 散度模糊度动态地重新加权对抗样本。我们的方法优化了围绕经验数据分布的分歧球内最坏情况的对抗性损失,自动强调更难的对抗性示例。使用凸对偶公式,目标在 KL 散度下简化为 log-sum-exp 形式,并用动态参数控制重新加权的强度。这项研究提出了一种新的信息论目标,可以在保持模型实用性的同时显着降低攻击成功率。在多个 LLM 和攻击设置中,WARDEN 大大降低了攻击成功率,其计算和实用成本与基于 CAT、CAPO 和 MixAT 的基线相当,使其成为可扩展的稳健对齐的实用方法。