论文

通过弱监督训练消除 LLM 中的沙袋

Removing Sandbagging in LLMs by Training with Weak Supervision

模型训练监督微调与指令调优

摘要

随着人工智能系统开始自动执行复杂的任务,监督越来越依赖于较弱的模型或有限的人工监督,无法完全验证输出质量。一个比其主管更有能力的模型可以通过沙袋来利用这一差距,制作出看似可以接受但达不到其真实能力的工作。即使没有可靠的验证,训练也能激发模型的最佳性能吗?我们使用经过沙袋训练的模型生物来研究这一问题,测试解决数学问题、研究生水平的科学和竞争性编码任务的启发技术。我们发现,当监督 微调 (SFT) 和强化学习 (RL) 相结合时,弱监督训练可以可靠地引出沙袋模型:弱演示上的 SFT 打破了沙袋行为,使 RL 能够充分引出性能。这两种方法都无法单独可靠地成功——没有 SFT 的 RL 几乎总是导致 奖励作弊 而不是真正的改进,并且当监督者比不受信任的模型弱得多时,没有 RL 的 SFT 无法充分发挥性能。至关重要的是,这依赖于训练与部署无法区分;当模型能够区分训练和部署时,它们可以在训练期间表现良好,而之后继续沙袋。我们的结果提供了初步证据,表明训练是对抗沙袋的可行缓解措施,同时强调了使训练与部署难以区分的重要性。