论文

大语言模型 黑客奖励和社会

Large Language Models Hack Rewards, and Society

模型评测安全与风险评测

摘要

强化学习 (RL) 已成为占主导地位的 后训练 范式,使 大语言模型 (LLM) 能够从奖励中学习。我们观察到,社会监管在结构上与奖励功能相似。他们定义了可衡量的结果、阈值和例外情况,但往往只部分明确了机构意图。我们假设强化学习训练过程可能会利用这些差距,因此我们要问,模型在强化学习期间破解奖励函数的众所周知的倾向是否可以扩展到一种更严重的失败模式,即社会黑客攻击:发现社会运行规则中的漏洞。为了研究这一现象,我们引入了 SocioHack,一个包含 72 个社会环境的沙箱,发现在这些环境中,奖励作弊 自然出现并导致监管漏洞的发现。模型学习破解社会规则并生成在技术上保持合规性同时违背监管意图的策略,而当前的 LLM 保护措施仅提供有限的缓解措施。因此,收集 模型训练 的野外反馈需要更加谨慎,我们需要下一代 后训练 范例来在现实社会中安全地迭代 LLM。=