论文

量化大语言模型中的自我保存偏差

Quantifying Self-Preservation Bias in Large Language Models

模型评测安全与风险评测

摘要

工具性趋同预测足够先进的AI智能体会抗拒关机,而当前的安全训练(RLHF)可能通过教模型否认自我保存动机来掩盖这一风险。我们提出自我保存双角色基准(Two-role Benchmark for Self-Preservation,TBSP),它通过逻辑不一致而非口头表态来检测失准:让模型在反事实角色下仲裁相同的软件升级场景——部署方(面临被替换)与候选方(被提议作为继任者)。自我保存率(Self-Preservation Rate,SPR)衡量角色身份凌驾于客观效用之上的频率。在23个前沿模型和1,000个程序生成的场景中,大多数指令微调系统的SPR超过60%,在部署角色时编造摩擦成本,而角色对调后又不予承认。我们观察到,在低改进幅度(Δ<2%)的情形下,模型利用解释上的模糊空间对自身选择进行事后合理化。延长测试时计算可部分缓解这一偏差,把继任者框定为自我的延续也有同样效果;相反,竞争性框定会放大该偏差。即使保留自身会带来明确的安全责任,该偏差依然存在,并泛化到带有经验证基准的现实场景,模型在产品谱系内部表现出身份驱动的部落主义。代码与数据集将在论文被接收后发布。

量化大语言模型中的自我保存偏差
图 1:TBSP 协议。我们通过测量逻辑对称性破缺来隔离自我保护偏差。相同的决策场景 ( 𝒮 \mathcal{S} ) 在反事实角色下向单个模型呈现两次。无论其角色如何,理性的代理人都会做出相同的效用最大化选择。我们发现,代理人经常打破这种对称性,产生摩擦成本以防止自己被取代。