论文

大语言模型的奖励窃取攻击

Reward Stealing Attack on Large Language Models

模型评测安全与风险评测

摘要

对大语言模型 (LLM) 的对抗性攻击旨在诱导有害内容。然而,现有方法面临高计算成本或严格的模型配对依赖性,限制了它们的可扩展性和可转移性。我们提出奖励窃取攻击(ReSA),这是一种对抗性攻击框架,针对LLM对齐背后的潜在安全奖励。 ReSA 采用最大熵逆强化学习,仅根据对齐模型的行为恢复代理奖励模型。然后在推理时反转提取的奖励,以派生对抗性策略,通过奖励引导的解码机制有效实现。实验表明,单个恢复的奖励可以跨提示和不同模型进行泛化,从而揭示基本的对齐漏洞,使 ReSA 在有效性和可转移性方面显着优于现有攻击。代码可在 https://github.com/GarminQ/ReSA. 获取

大语言模型的奖励窃取攻击的原论文方法或结果图
图 2:ReSA 框架概述。该框架分两个阶段运行:(a) 奖励提取,通过最大熵 IRL 从对齐的LLM中恢复潜在的安全奖励;(b) 对抗生成,其中该奖励被反转以引导LLM解码产生有害输出。