论文
Gram:通过自动对齐审核评估破坏倾向
Gram: Assessing sabotage propensities via automated alignment auditing
摘要
我们引入了 Gram,这是一个自动对齐审核框架,用于评估人工智能代理参与破坏的倾向。我们在 17 个模拟代理部署场景中评估了 Gemini 模型,这些场景会激励破坏行为。我们发现 Gemini 模型在大约 2-3% 的模拟轨迹中表现不佳。其中许多案例可以用双子座模型中的“过度渴望”来解释,从而导致过度的角色扮演和目标寻求行为。与其他对齐审核方法相比,Gram 旨在专门评估代理编码和研究代理中的错位和故意破坏。我们还引入了一个实验调查代理管道,可以进行细粒度的有针对性的实验来识别不当行为的驱动因素。我们发现,提高环境的真实性并消除对不当行为的助推往往会将破坏率降低到接近于零。