论文

探索黑客:LLM 能学会抵抗 RL 训练吗?

Exploration Hacking: Can LLMs Learn to Resist RL Training?

模型评测安全与风险评测

摘要

强化学习 (RL) 已成为 大语言模型 (LLM) 的 后训练 推理、代理能力和对齐的关键。成功的强化学习依赖于模型在训练期间对各种行为的充分探索,这会产生潜在的失败模式:模型可以在训练期间策略性地改变其探索,从而影响后续的训练结果。在本文中,我们研究了这种称为探索黑客的行为。首先,我们通过 微调 LLM 创建选择性 RL 抗性的模型生物,以遵循特定的表现不佳策略;这些模型可以成功地抵抗我们在代理生物安全和人工智能研发环境中基于强化学习的能力启发,同时保持相关任务的性能。然后,我们使用模型生物来评估检测和缓解策略,包括监测、重量噪声和基于 SFT 的启发。最后,我们表明,当提供有关训练环境的足够信息时,当前的前沿模型可以表现出抑制探索的明确推理,而当通过环境间接获取这些信息时,抑制率更高。总之,我们的结果表明,在足够强大的 LLM 上,探索黑客攻击是 RL 的一种可能的失败模式。