论文

电路锚点的安全进化

Safe Evolution with Circuit Anchors

模型评测安全与风险评测

摘要

在生物进化中,不受限制的突变可能会导致灾难性的结果:生物体可能会进化出增强的能力,同时失去生存的基本功能。大自然的解决方案是\textit{发育限制},其中核心调控基因保持锚定,而外围基因自由适应。我们观察到当前 大语言模型 的自进化算法缺乏类似的约束。他们纯粹针对功能进行优化,隐含地假设安全性将得到保留。我们的实验表明这个假设是危险的错误:模型可以\textit{misevolve}成强大但危险的实体。受 Hox 基因在 5 亿美元的进化过程中如何锚定身体结构的启发,我们提出了 \textbf{电路锚定进化(CAE)}。利用机械可解释性,我们识别出一个微小的 \textit{安全电路},包含不到 $2$\% 的模型特征,可以因果地调节安全行为。我们在进化过程中锚定了这个电路,将其限制在一个小的位移范围内,同时允许其余特征自由进化。这反映了\textit{有约束的进化性}的生物学原理:保留本质的东西,同时适应外围的东西。 3 美元模型系列和两种进化算法的实验表明,CAE 以最小的能力损失实现了卓越的安全保护,在有效性和效率方面大大优于基于奖励的显式约束。正如发育限制阻止生物进化产生无法生存的有机体一样,电路锚定也阻止模型进化产生有能力但危险的系统。