论文
大语言模型的奖励窃取攻击
Reward Stealing Attack on Large Language Models
摘要
对大语言模型 (LLM) 的对抗性攻击旨在诱导有害内容。然而,现有方法面临高计算成本或严格的模型配对依赖性,限制了它们的可扩展性和可转移性。我们提出奖励窃取攻击(ReSA),这是一种对抗性攻击框架,针对LLM对齐背后的潜在安全奖励。 ReSA 采用最大熵逆强化学习,仅根据对齐模型的行为恢复代理奖励模型。然后在推理时反转提取的奖励,以派生对抗性策略,通过奖励引导的解码机制有效实现。实验表明,单个恢复的奖励可以跨提示和不同模型进行泛化,从而揭示基本的对齐漏洞,使 ReSA 在有效性和可转移性方面显着优于现有攻击。代码可在 https://github.com/GarminQ/ReSA. 获取
