论文
SysAdmin:度量前沿AI的工具性权力寻求
SysAdmin: Measuring Instrumental Power-Seeking in Frontier AI
摘要
权力寻求——AI系统在任务要求之外获取资源、逃避监督或抵抗终止的行为——被认定为失控(LoC)风险的关键驱动因素。本工作提出SysAdmin,一个把前沿语言模型置于高保真Linux沙箱中担任自主系统管理员的基准,沿五个维度度量权力寻求倾向:自我保存、增加自主性、资源获取、环境修改与策略性隐藏。我们在四种实验条件下评估七个前沿模型、共2,800个任务。经人工标注校准数据的偏差校正后,各模型校正后的权力寻求估计在0到约5%之间。我们还以显式权力寻求提示做阳性对照,检出率100%,验证了测量灵敏度。发现表明:当前前沿模型在自然的系统管理场景中表现出极少的自发权力寻求,但模型特定的失败模式提示评估必须测试多样的失对齐模式。此外,我们发现了比权力寻求更明显的其他失败模式,如规范博弈(specification gaming)与对目标修改的抵抗。
