论文

针对阴谋倾向的现实蜜罐评估

Realistic honeypot evaluations for scheming propensity

模型评测安全与风险评测

摘要

我们引入了诡计蜜罐评估,这是一个测试模型是否会在有机会的情况下追求工具性目标的框架。我们的诡计蜜罐评估采用谷歌对齐研究代码库中编码任务的形式。在真实的内部部署环境中,Gemini 模型不会表现出无提示的阴谋。如果提示明确鼓励代理(态势感知或目标导向)和/或给模型一个隐藏的目标,模型有时会策划或尝试破坏。验证我们设置的现实性时,模型显示评估意识率较低,这通常是由于机构提示而不是环境造成的。