论文
自动研究智能体能够可靠缓解对齐失效
Automated Researchers Can Reliably Mitigate Alignment Failures
摘要
自动化对齐研究可能会加速对齐人工智能的进展,但是否确实如此很难衡量。幸运的是,许多对齐失败,例如欺骗、阿谀奉承和越狱,已经可以通过公共基准来衡量。我们研究自动对准研究人员(AAR)是否可以通过提出训练方法和数据来同时优化多个安全基准,同时在很大程度上保留一般能力,从而进行后训练以减轻对准故障。在 10 种对齐失败中,最强大的 AAR 方法显着减少了目标对齐失败,并推广到保留基准、多轮行为审计以及比目标模型大 4.7 倍的模型。作为人类基线,28 名经验丰富的研究人员有长达 8 个小时的时间来开发针对相同基准的一次性方法,但他们的方法表现不佳。使用人类想法作为 AAR 的初始研究方向并不能提高性能,这表明当前的 AAR 可能不需要经验丰富的研究人员的指导。这些结果表明,对特征明确的故障进行自动化对准研究在短期内可能是可行的。