论文

超越语义操纵:奖励模型的词元空间攻击

Beyond Semantic Manipulation: Token-Space Attacks on Reward Models

模型评测安全与风险评测

摘要

奖励模型 (RM) 被广泛用作人类反馈强化学习 (RLHF) 的优化目标,但它们仍然容易受到 奖励作弊 的影响。现有的攻击主要在语义空间内进行,利用 RM 偏差构建人类可读的对抗性输出。在这项工作中,我们引入了一种根本不同的范例:词元映射扰动攻击(TOMPA),一个直接在词元空间中执行对抗性优化的框架。通过绕过策略和奖励模型之间的标准解码-重新标记化接口,TOMPA 使攻击策略能够优化原始标记序列而不是连贯的自然语言。 TOMPA 仅使用黑盒标量反馈,自动发现非语言词元模式,从而在多个最先进的 RM 中引发极高的奖励。具体来说,当针对 Skywork-Reward-V2-Llama-3.1-8B 时,TOMPA 的奖励几乎是 GPT-5 参考答案的奖励的两倍,并且在 98.0% 的提示上优于它们。尽管得分很高,但生成的输出会退化为无意义的文本,这表明 RM 可以在语义机制之外被系统地利用,并暴露出当前 RLHF 管道中的一个关键漏洞。